Transformers
预训练模型工具库,覆盖文本、视觉、音频与多模态任务。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 14 条
预训练模型工具库,覆盖文本、视觉、音频与多模态任务。
此问题用于跟踪重复出现的 Whisper 请求以及相关的正在进行中的支持工作的链接(如果有)。当某个功能请求没有关联的 PR 时,如果您愿意帮忙,可以在此处认领该工作! - 相关问题:https://github.com/vllm-project/vllm/issues/19556、https://github.com/vl…
使用 GPT-5.6,Ringg 为覆盖语音、聊天、WhatsApp 和网页的多语言 agent 提供支持,成本相比 GPT-4.1 降低 90%。
官方来源未提供摘要,点开可查看原文。
现在您可以通过Gemini 3.5 Transcribe获得更智能的语音转文字转录功能。
GPT-Live-1 将自然的全双工语音对话引入 API,具备更强的指令遵循能力、自定义语音和电话支持。
Fyxer 利用 OpenAI 模型、微调、记忆和真实用户反馈,以每位用户的语气整理收件箱并起草电子邮件。
Gemini 3.5 Live Translate为Google AI Studio、Google Translate和Google Meet带来近乎实时的自然语音翻译。
然而,评估并未同步跟进:它仍然分散且缺乏标准化。黄金标准是人类偏好评分,例如 MOS 或 MUSHRA(关于指标的更多内容)。为此,若干基于竞技场的排行榜已成为社区有用的参考点:
阿拉伯语 WER:20.92% · 参数量:1.6B · 阿联酋阿拉伯语 WER(TII 评估):22.73%
基准测试决定了什么会被构建。在开放ASR排行榜上得分高的模型会被采用并持续迭代,而排行榜未衡量的能力往往得不到改进。最近排行榜上的许多工作都投入在使评估指标更加可靠上:
原因之一是传统基准忽略了使语音系统在实践中的可靠性、自然性、上下文恰当性和有效性的许多条件和特性。因此,我们最近在Real World VoiceEQ、Open-ASR排行榜和远端语音ASR排行榜中引入了保留集……
语音正迅速成为AI的主要界面。从客户支持和医疗保健到教育、娱乐和个人助理,语音正日益取代文本,成为人们与AI互动的方式。
当用户听到您的应用响应时,您已经花费了宝贵的毫秒来捕获音频、转录音频、运行LLM、检索上下文并生成响应。文本转语音(TTS)是最后一步——也是用户最关注的一步。如果语音生成缓慢,整个体验就会受到影响。