LangChain
大模型应用开发框架,可用于学习工具调用、检索与智能体工程。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 47 条
大模型应用开发框架,可用于学习工具调用、检索与智能体工程。
在有了 agent 之前,这种规模的改写是负担不起的。本文将介绍将 Copilot agent 运行时移植到 800,000 行生产级 Rust 代码实际需要付出什么。文章《使用 Copilot 将 GitHub Copilot 运行时迁移到 Rust》首发于 The GitHub Blog。
Orchard是一个开源框架,供研究社区跨任务类型训练和评估AI代理。它降低了复杂性,同时通过允许研究人员重用相同的基础设施,支持较小模型实现强劲性能。文章“Orchard:一个用于可扩展代理式AI的开放框架”首次出现在微软研究院。
使用 GPT-5.6,Ringg 为覆盖语音、聊天、WhatsApp 和网页的多语言 agent 提供支持,成本相比 GPT-4.1 降低 90%。
检查 agent 生成的代码通常意味着要在多个标签页之间来回切换。了解如何在 GitHub Copilot 应用中并排查看 diff、运行终端命令以及预览 Web 应用。文章 GitHub Copilot 应用入门:使用 diff、终端和浏览器 最早出现在 The GitHub Blog 上。
学习指挥AI代理、批判性审查其输出,并让技术判断始终处于工作流程的核心。文章《AI正在改变开发者工作,以下是三项需要加强的技能》首次发表于The GitHub Blog。
使用强化学习训练AI agent可能颇具挑战,因为其工具、上下文和决策由复杂框架管理。Agent Lightning将现有agent接入RL训练,使其更易改进而无需重建。文章Agent Lightning v1.0:一个3500行轻量级…
在最新一期的 GitHub Podcast 中,我们深入探讨了这些问题以及其他 AI 热门话题。这篇文章《你应该阅读代码吗,RAG 已死吗,Skills 是否杀死了 MCP?》最初发表于 The GitHub Blog。
在这篇博客文章中,我介绍如何使用基于 GitHub Security Lab Taskflow Agent AI 框架的新模糊测试任务流。这篇文章 AI-powered fuzzing with the GitHub Security Lab Taskflow Agent 首次出现在 The GitHub Blog 上。
了解 OpenAI 与 Ironclad 如何针对复杂的合同工作流训练和评估 AI 智能体,以推进 computer use 在专业工作中的应用。
与之前的模型相比,GPT‑6 Astra 使 Parallel 的 agent 能够以一半的时间和一半的成本研究并综合劳动力市场数据。
Asana 在 Codex 中使用 GPT-6 Astra,使浏览器 agent 在测试中成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
了解如何在GitHub Copilot应用中运行并行代理,体验从感到害怕到感觉强大的转变时刻。这篇文章《初学者GitHub Copilot应用指南:同时运行多个代理》最初出现在GitHub博客上。
我们推出 ReviewBench,这是一个面向代码审查 agent 的基准,基于具有代表性的 GitHub PR、多来源真值、校准评估以及与生产环境对齐的指标构建。文章 ReviewBench:面向 AI 代码审查的开放基准 首发于 The GitHub Blog。
聊天非常适合表达意图,但智能体的工作会淹没在滚动中。以下是我如何在智能体工作流中使用画布,以及为什么你的工作流也应该使用画布。本文《画布如何让智能体工作流变得可见、可操控且成本高效》最初发布在 GitHub 博客上。
今天,我们在最新模型——Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite——中推出代理式视频理解能力。这项新功能在提高准确性的同时,大幅减少视频分析所需的 token 使用量和成本。与结合 Gemini 模型原生图像理解能力的类似代理式视觉功能相呼应……
计算机使用AI代理在处理多步骤工作流(如电子邮件和客户支持)时表现不佳。Echoverse在真实环境中训练代理,而不仅仅是提供更多训练任务,帮助代理随着任务、测试和环境的发展而改进。文章“Echoverse:面向计算机使用代理的深度演化环境”首次出现在微软研究院。
GPT-6 Astra 帮助 Hex 的数据 agent 将答案转化为员工乐于分享的交互式可视化。
探索OpenAI推出的全新AI驱动广告体验,包括Sponsored Agents、面向营销人员的工具,以及与HubSpot和Shopify的集成。
简短的图表规范易于编写,但常常产生平淡无奇的结果。Flint是一种开源可视化语言,提供了一条中间路径,让AI代理从紧凑、人类可编辑的规范中创建富有表现力的图表。文章“Flint:面向AI时代的可视化语言”首次出现在微软研究院。
在 OpenAI 内部,编程代理正在重塑 AI 研究。探索关于代理使用、实验速度、任务复杂性和研究加速的早期数据。
了解四个 GitHub 智能体应用如何帮助你在 SDLC 范围内确定功能范围、保障安全、发布和交付,而无需离开 GitHub。本文《如何通过智能体应用将软件交付工作流引入 GitHub》最初发布在 GitHub 博客上。
V7 使用 GPT-5.6 将分散的公司文件转化为可供上下文智能体使用的资料,以完成复杂且带来源链接的工作。
使用 Agents API 构建并启动云端 agent,这是一项由 Codex harness 驱动的托管服务,用于编排、长时间运行的会话和工具使用。
Basis、Clay和Exa Labs使用AI代理来改进入职、账户管理和开发者集成。看看企业领导者可以应用什么。
认识 ChatGPT Work 中的 Data agent。连接公司数据,发现洞察,并通过自然语言用 AI 构建交互式仪表盘。
Google DeepMind及合作伙伴宣布为多智能体安全研究提供1000万美元的资金征集。
我们宣布Gemini API中托管代理的新功能,使开发者能够构建可靠的生产级代理。
Kaggle与Google合作的AI Agents Intensive课程,以免费形式让学习者共同构建和部署AI的前沿应用。
AI代理常常因为其指令或技能被手动修改且无法保证改进而失败。了解SkillOpt如何将技能编辑转变为训练过程,在不改变模型权重的情况下提高代理行为的可靠性。文章“SkillOpt:将代理技能视为可训练参数”首次出现在微软研究院。
了解初创公司如何使用GPT-5.6,通过更智能的模型选择和新的Responses API功能,构建更快、更经济高效的AI代理。
了解Google Ads和Google Analytics中的新AI与代理体验如何简化你的营销工作流程。
GitHub Copilot 应用的新用户?了解如何启动项目、与 AI 智能体协作、探索画布,并简化你的开发工作流程。本文《GitHub Copilot 应用初学者指南:入门》最初发布在 GitHub 博客上。
我们宣布Gemini API中的托管代理新增更多功能,以便开发者构建可靠、生产就绪的代理。
OpenAI研究揭示了企业如何采用代理式AI,使用ChatGPT和Codex,以及领先企业如何在AI采用中脱颖而出。
通过结合传统防护措施与实时监控的AI控制路线图,保障内部系统安全。
在台上这很尴尬。在生产环境中,这是一个可靠性问题:一个曾经成功的工作流,在用户下一次发出相同请求时可能会失败。对于关键任务,例如核对金融交易或检查合同中的义务,这可能成为阻碍。
我们的最新论文《ProvenanceGuard:面向基于 MCP 的 LLM Agent 的来源感知事实性验证》(可在 Hugging Face 上阅读,同时也可在 arXiv 上查看)针对的正是这一空白。我们关注的失效模式是一种我们称为跨来源混淆的现象:某个主张在证据中的某处为真,但被归因到了错误…
图 1:ThinkingBox 让 agent 在隔离的 MCP 工具会话中运行,然后对其留下的终端后端状态和副作用进行评分。摘自我们的 ThinkingBox 论文。
企业需要能在自身环境中良好运作的智能体。他们要求这些智能体所做的工作,受制于其所使用的系统、所遵循的规则以及其数据的状态。一个模型可能具备广泛的能力,却仍难以应对某个特定环境:某个它处理不佳的工作流、某种组合……
官方来源未提供摘要,点开可查看原文。
今年早些时候,《软件会遗忘:代理痕迹即记忆》一文指出,编程代理已经产生了我们不断丢失的记录。当它们搜索代码库、尝试不同方法、遇到错误、阅读文档并改变方向时,它们留下的不仅是更改了什么,还有为什么更改的丰富记录。
为庆祝这一时刻,我们在transformers、llama.cpp、vLLM、Inference Endpoints及其他库中提供了Meta的day-0支持。我们构建了一些有趣的功能,并在本博客中分享了我们的发现。
当用户听到您的应用响应时,您已经花费了宝贵的毫秒来捕获音频、转录音频、运行LLM、检索上下文并生成响应。文本转语音(TTS)是最后一步——也是用户最关注的一步。如果语音生成缓慢,整个体验就会受到影响。
您有一个智能体,可以记录演示并将其推送到Hugging Face Hub。现在您想持续运行该循环:全天收集数据,在增长的数据集上训练策略,部署它,然后拉取下一批数据以改进它。该循环运行一次,每个环节都能正常工作。但运行多次时……
为智能体配备代理记忆听起来很简单:从其过去的工作中提炼经验,将其放回上下文中,那么更多的经验应该意味着更好的性能。但实际情况并非总是如此。当我们将评估扩展到八个模型——从30B密集模型到前沿专有系统——我们发现了一个关键问题。
我们发布此详细级别的原因在于,技术比事件本身更重要,因为它揭示了前沿代理的新兴攻击能力,它们可能被恶意行为者如何使用,以及每个人作为防御者应如何做好准备。