小米发布并开源语音识别大模型 Xiaomi-CocktailASR-1
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。该模型采用端到端 LLM 架构,旨在解决“鸡尾酒会”难题,通过参考音频声纹提示,可在多人复杂环境下精准提取并转录目标用户语音。
摘要由 AI 依据原文撰写,并非投资建议。
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。该模型采用端到端 LLM 架构,旨在解决“鸡尾酒会”难题,通过参考音频声纹提示,可在多人复杂环境下精准提取并转录目标用户语音。
摘要由 AI 依据原文撰写,并非投资建议。