Project HydraFusion:通过多模型编排实现前沿质量
在受控的离线评估中,HydraFusion 的选择性编码工作流达到或超过了评估的 Opus 5 基线,同时降低了估算的工作流成本。现在作为研究预览版在 GitHub Copilot 中提供。文章 Project HydraFusion: Frontier quality via multi-model orchestration 最初出现在 The…
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 16 条
在受控的离线评估中,HydraFusion 的选择性编码工作流达到或超过了评估的 Opus 5 基线,同时降低了估算的工作流成本。现在作为研究预览版在 GitHub Copilot 中提供。文章 Project HydraFusion: Frontier quality via multi-model orchestration 最初出现在 The…
Skala 1.1是微软研究院推出的更新版深度学习交换关联泛函,它提供了更高的精度、在计算化学生态系统中更广泛的可用性,以及一个用于跟踪计算性能的实时基准。文章“扩展Skala访问权限,为预测性DFT铺就更快路径”首次出现在微软研究院。
Orchard是一个开源框架,供研究社区跨任务类型训练和评估AI代理。它降低了复杂性,同时通过允许研究人员重用相同的基础设施,支持较小模型实现强劲性能。文章“Orchard:一个用于可扩展代理式AI的开放框架”首次出现在微软研究院。
了解 OpenAI 与 Ironclad 如何针对复杂的合同工作流训练和评估 AI 智能体,以推进 computer use 在专业工作中的应用。
MentalHealthBench 是一个由专家参与制定的基准,用于评估 AI 在贴近现实的心理健康对话中给出的有益且安全的回复。
一条路径、一道栅栏、一个绳结。MindTopo为测试AI如何理解拓扑关系设立了新基准,并强调了加强空间推理和规划的新机遇。文章“MindTopo揭示VLM的空间推理能力”首次出现在微软研究院。
我们推出 ReviewBench,这是一个面向代码审查 agent 的基准,基于具有代表性的 GitHub PR、多来源真值、校准评估以及与生产环境对齐的指标构建。文章 ReviewBench:面向 AI 代码审查的开放基准 首发于 The GitHub Blog。
这是我们评估用于真实世界秘密扫描的LLM时学到的经验。文章《如何在上线前评估LLM》首发于GitHub博客。
OpenAI勾勒了通往全球共享AI标准的路径,呼吁通过协调一致的评估、报告和治理来提升安全性。
试点全球首个双盲AI评估
OpenAI正在分享对Astra的初步网络安全评估,以及我们为加强安全防护和控制所采取的步骤。
然而,评估并未同步跟进:它仍然分散且缺乏标准化。黄金标准是人类偏好评分,例如 MOS 或 MUSHRA(关于指标的更多内容)。为此,若干基于竞技场的排行榜已成为社区有用的参考点:
AISI 与 EvalEval 此前曾开展合作研究,该研究始于 NeurIPS 2025 期间的一场联合研讨会,来自该研究所的反馈帮助塑造了 Every Eval Ever(EEE)schema。合作的下一阶段将把这一共享基础设施付诸实践。
今天我们推出 BenchMIRT,一种在单个提示级别(即模型被评分的具体问题和任务)审计 LLM 基准测试的新方法。
基准测试决定了什么会被构建。在开放ASR排行榜上得分高的模型会被采用并持续迭代,而排行榜未衡量的能力往往得不到改进。最近排行榜上的许多工作都投入在使评估指标更加可靠上:
原因之一是传统基准忽略了使语音系统在实践中的可靠性、自然性、上下文恰当性和有效性的许多条件和特性。因此,我们最近在Real World VoiceEQ、Open-ASR排行榜和远端语音ASR排行榜中引入了保留集……