迈向前沿AI训练的安全案例
我们针对前沿AI训练安全案例的早期指南涵盖技术保障措施、运营实践以及调查不对齐事件
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 34 条
我们针对前沿AI训练安全案例的早期指南涵盖技术保障措施、运营实践以及调查不对齐事件
OpenAI 阐述了针对前沿模型和防护措施开展严谨、安全且独立的第三方 AI 安全评估的优先事项与原则。
了解 OpenAI 如何打击一场旨在提取受保护模型推理过程的行动,以及如何加强针对对抗性蒸馏的防御。
了解 Sophos 如何使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化 52% 的 MDR 案例,同时保留人工监督。
OpenAI正在将其Daybreak项目的访问权限扩展至乌克兰政府,以支持民用基础设施的网络防御。
OpenAI CEO Sam Altman 在向联合国安理会发言时讨论了 AI 安全、人类控制以及国际合作。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并概述了更完善的保障措施与支持,以加强澳大利亚的网络防御。
OpenAI 与 GSA 将为符合条件的联邦、州、地方和部落政府提供 $0 许可费用、50% 使用折扣以及扩展的网络防御支持。
Chris Lehane认为,更强大的AI能力需要更强的安全证据、共同的标准和持久的政策行动,趁政策窗口仍然开放之际。
希望使用先进 AI 的防御者长期面临两难:采用庞大的前沿模型,这些模型部署成本高昂,且难以在企业代码库中控制;或者转向可能难以处理复杂漏洞修复的小型开放权重模型,并要求团队自行构建……
立即申请OpenAI的500万美元拨款计划,该计划支持关于生成式AI如何影响青少年发展、福祉和安全的独立研究。
OpenAI勾勒了通往全球共享AI标准的路径,呼吁通过协调一致的评估、报告和治理来提升安全性。
OpenAI推出Daybreak for Frontline Defenders,承诺投入10亿美元,扩大前沿网络AI、培训和对关键服务的支持。
OpenAI 推出澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,保护和赋能青少年。
在三个月前 3.7 Flash 成功的基础上,并在短短六周内推出我们的第三个 Flash 版本,今天我们推出 Gemini 3.8——这是我们迄今最好的推理和编码模型,同时保持了 3.7 的速度和低成本。Gemini 3.8 提供两个变体:
Paul Christiano加入OpenAI基金会董事会及其安全与安保委员会,带来了在AI对齐、安全和标准方面的经验。
OpenAI支持加州SB 1119法案,推进针对青少年的强有力且适龄的AI安全保护措施,同时保留学习、创造和探索的机会。
GPT-6 Astra是我们能力最强、部署最广泛的模型,也是我们在预备框架下首个达到网络安全能力关键水平的模型。
OpenAI分享了Hugging Face安全事件的发现,以及我们为加强AI模型安全、监控和一致性所采取的步骤。
推出GPT-6 Astra,这是我们迄今为止最智能、最对齐的模型,在计算机使用、编程、网络安全和科学领域具备最先进的能力。
Astra 是 OpenAI 首个在《预备框架》下达到“关键网络安全能力”阈值的模型,其发布配备了更强的防护措施。
OpenAI 和 AWS 正在通过 Amazon Bedrock 提供 Daybreak 网络安全功能,以支持企业安全工作流。
Google DeepMind及合作伙伴宣布为多智能体安全研究提供1000万美元的资金征集。
AI 正在重塑网络安全的攻防双方格局。了解 OpenAI 如何加强防御,以及安全团队现在可以采取哪些行动。
OpenAI正在分享对Astra的初步网络安全评估,以及我们为加强安全防护和控制所采取的步骤。
OpenAI正在加强对前沿AI模型的监控、对齐和安全。了解新的安全措施如何指导模型开发的节奏。
我们推出新的Gemini模型,包括Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。
Google推出Gemini 3.5 Flash Cyber,一款轻量级网络安全模型,用于发现和修补漏洞。
认识 GPT-5.6-Cyber,OpenAI 的网络安全专用模型,可通过 Daybreak Red 用于授权的漏洞研究、漏洞验证和安全测试。
OpenAI重申对符合条件的API客户提供零数据保留,并预览私有安全处理,在不损害数据隐私的前提下实现高级AI安全。
经批准的 Daybreak 合作伙伴可以使用 OpenAI 的前沿网络模型,向客户提供授权、合规的网络安全服务。
Anthropic 官方发布的模型、安全与可解释性研究动态。
实际部署很少符合话题级别的图景。同一个基础模型可能被适配用于通用助手、教育产品、企业系统或公共部门服务,每种场景在相同话题内需要不同边界。公民教育导师和公共部门助手可以共享一个模型……
包含程序设计、Web、软件测试、网络安全与人工智能等跨方向赛项的官方入口。