Meta发布实时音频感知AI模型Muse Voice Transcribe,支持20余人分轨转写

PANews 9月2日消息,据IT之家援引9to5Mac报道,Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1,000分钟音频3美元(约合每小时0.18美元)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时可同步输出文字,无需等待完整录音结束后再处理。模型支持70余种语言(25种已验证)、超1小时音频及多语言切换,可在包含20余名说话者的录音中分离不同发言者。Meta引入自适应延迟机制,对易识别语音快速输出,对复杂词语调用更多上下文以兼顾速度与准确度。截至9月1日,该模型在Artificial Analysis流式语音转文本排行榜中位列第一。

分享至:

作者:PA一线

本内容只为提供市场信息,不构成投资建议。

关注PANews官方账号,一起穿越牛熊
PANews APP
Yam Finance遭恶意治理接管攻击,约33.7万美元资产面临风险
PANews 快讯