Meta推出Muse Voice Transcribe:实时转写支持超20人发言,70余种语言覆盖

   发布时间:2026-09-02 13:03 作者:陆辰风

meta公司近日正式推出其首个实时音频感知模型——Muse Voice Transcribe,这一创新技术为语音转写领域带来了新的突破。开发者可通过meta Model API调用该模型,其定价为每1000分钟音频3美元(约合人民币20.2元),即每小时0.18美元(约合人民币1.2元),这一价格策略为开发者提供了高性价比的选择。

Muse Voice Transcribe的核心优势在于其流式自动语音识别能力,实现了边说边转写的功能。与传统的语音转写技术不同,该模型无需等待完整录音结束后再进行处理,而是能够实时、持续地输出文字结果。这种特性使得它在实时听写、会议记录、通话字幕等场景中具有显著优势,大大降低了延迟,提高了工作效率。

在技术实现上,Muse Voice Transcribe整合了说话人分离与端点检测功能。它能够在包含20余名说话者的录音中准确分离不同发言者,并识别说话的结束点,从而自动确定一段输入的边界。这一功能对于多人会议或访谈等场景尤为重要,能够确保转写结果的准确性和条理性。

该模型还具备强大的语言支持能力。其训练覆盖了70余种语言,其中25种语言在发布时已完成验证。无论是长音频还是短音频,无论是单一语言还是句内或句间的自然语言切换,Muse Voice Transcribe都能轻松应对。开发者还可以通过语言、关键词和上下文偏置来优化模型,提高特定语言、术语或场景下的识别效果。

为了兼顾实时响应和识别准确度,meta引入了自适应延迟的动态决策机制。该机制不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。对于较容易识别的语音,系统会更快提交转写结果;而对于发音不清、术语较多或语境复杂的词语,系统则会调用更多前后文音频信息进行分析。这种机制确保了模型在各种场景下都能保持高效的性能。

根据Artificial Analysis的流式语音转文本排行榜显示,截至2026年9月1日,Muse Voice Transcribe位列榜首。这一成绩充分证明了该模型在语音转写领域的领先地位和卓越性能。随着技术的不断发展和完善,Muse Voice Transcribe有望为更多行业和场景带来便捷和高效的语音转写解决方案。

 
 
更多>同类内容
全站最新
热门内容