如何在上线前评估LLM
这是我们评估用于真实世界秘密扫描的LLM时学到的经验。文章《如何在上线前评估LLM》首发于GitHub博客。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
可搜索 · 可筛选 · 可追溯
每条信息都保留来源、核验时间和适用条件。用方向、难度、参与形式与截止时间,找到现在真正能做的事。
当前显示全部条目
第 9 / 17 页 · 共 405 条
这是我们评估用于真实世界秘密扫描的LLM时学到的经验。文章《如何在上线前评估LLM》首发于GitHub博客。
密码学代码为现代计算系统中的关键保护提供支持。了解一种新方法如何帮助开发者在编写代码时进行验证,同时在实现和演进过程中保持速度和适应性。文章“在SymCrypt中验证Rust密码学:从标准到代码”首次出现在微软研究院。
谷歌图片迎来25周年。让我们回顾一些重要里程碑——以及探索和创作视觉内容的新方式。
推测解码如何用于 VLM?视觉草稿模型采用与我们的文本 LFM2.5-DSpark 草稿模型相同的架构:它在固定的一组被选层捕获目标模型的隐藏状态,并以此为条件草拟一个包含 k 个候选 token 的块。图像 patch 和文本 token 被投影到一个 sh…
了解 OpenAI 与 Ironclad 如何针对复杂的合同工作流训练和评估 AI 智能体,以推进 computer use 在专业工作中的应用。
Google DeepMind与游戏工作室合作,原型化突破性的AI游戏玩法。
如果你同时处理多个 Copilot 会话,请使用“我的工作”面板来跟踪进行中、已完成和下一步的工作。本文《GitHub Copilot 应用初学者指南:管理工作》最初发布在 GitHub 博客上。
Aurora 1.5为Aurora基础模型增加了22个变量、小时级时间分辨率和概率集合预报,使其对实际天气、气候和能源应用更有用。文章“Aurora 1.5:扩展开放基础模型,用于天气和地球系统应用”首次出现在微软研究院。
一位Google专家解释了全栈式AI方法的含义,以及为什么它长期以来一直是我们在AI工作上的基础。
阿拉伯语实际上是一个名字下的一整个语族。现代标准阿拉伯语是你在新闻或教科书里读到的那种,但人们日常交谈时很少这么说话。在阿联酋,日常对话、幽默、谈判和讲故事都用阿联酋阿拉伯语,这是一种海湾方言,有自己的词汇……
探索 OpenAI DevDay 2026 上发布的 20 多项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
今天,我们在广泛使用的Flash系列进展的基础上,推出Gemini 3.7 Flash,这是我们针对编码和智能体的最智能的主力模型。
聊天非常适合表达意图,但智能体的工作会淹没在滚动中。以下是我如何在智能体工作流中使用画布,以及为什么你的工作流也应该使用画布。本文《画布如何让智能体工作流变得可见、可操控且成本高效》最初发布在 GitHub 博客上。
简短的图表规范易于编写,但常常产生平淡无奇的结果。Flint是一种开源可视化语言,提供了一条中间路径,让AI代理从紧凑、人类可编辑的规范中创建富有表现力的图表。文章“Flint:面向AI时代的可视化语言”首次出现在微软研究院。
新版Google Finance已退出测试版,并推出新的Android应用。
随着模型变得更快、工作负载不断扩展,这种平衡开始发生转变。在超大规模数据集上训练、同时服务大量并发请求,或反复处理长输入,都会对tokenizer施加足够大的压力,以至于使模型得不到数据供给。
了解 OpenAI 如何打击一场旨在提取受保护模型推理过程的行动,以及如何加强针对对抗性蒸馏的防御。
今天,Google DeepMind与A24宣布了一项开创性的研究合作。此次合作将世界领先的研究实验室与业内最具电影制作人导向的工作室相结合,帮助艺术家开发新的工作流程和技术。这确保了未来的工具由创作者塑造…
了解四个 GitHub 智能体应用如何帮助你在 SDLC 范围内确定功能范围、保障安全、发布和交付,而无需离开 GitHub。本文《如何通过智能体应用将软件交付工作流引入 GitHub》最初发布在 GitHub 博客上。
实验室主任Chris White一直致力于具有现实意义的研究挑战——从战时数据分析的新方法到打击人口贩运的工具。他与项目经理Weishung Liu谈论了引导他投身这项工作的各种影响及其他话题。文章《Called to serve: Tech, research, and positive impact with Chris White》...
Google 面向学生的实习、早期职业岗位与项目入口,岗位不限于 AI。
在台上这很尴尬。在生产环境中,这是一个可靠性问题:一个曾经成功的工作流,在用户下一次发出相同请求时可能会失败。对于关键任务,例如核对金融交易或检查合同中的义务,这可能成为阻碍。
借助 Codex、GPT-Live-1 和 GPT-6 Astra,Proaction 能够更快速地构建、运营和销售现代车队管理方案。
随机对照试验的结果显示了Gemini的引导学习功能在提升参与度和加速学习方面的潜力。