Meta发布新AI转录模型:可实时区分多名说话人和多种语言

Meta发布了一款新的AI转录模型,能在实时处理音频时同时识别不同说话人,并区分多种语言。相比只把语音转成文字的常规转录工具,这次更新把“谁在说话、说的是哪种语言”也纳入了输出,适合需要即时字幕、会议记录、播客整理和跨语言通话的场景。它的重点是实时处理,而不是等整段录音结束后再离线转写。对依赖语音内容的产品来说,这意味着转录结果更接近带说话人标记的现场记录,后续整理和检索也更直接。据Engadget报道。

来源:Engadget

原始发布时间:2026年9月1日 21:56