打击有组织的模型蒸馏活动
了解 OpenAI 如何打击一场旨在提取受保护模型推理过程的行动,以及如何加强针对对抗性蒸馏的防御。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 8 条
了解 OpenAI 如何打击一场旨在提取受保护模型推理过程的行动,以及如何加强针对对抗性蒸馏的防御。
Fyxer 利用 OpenAI 模型、微调、记忆和真实用户反馈,以每位用户的语气整理收件箱并起草电子邮件。
LoRA support recently landed in TRL's AsyncGRPOTrainer with PR #7017 , and ships with TRL v1.14. The asynchronous trainer can now train an adapter instead of the full model, and it syncs only the LoRA adapter to vLLM. This post covers a real-world project built on top of it, where training and inference no longer shar…
标题与摘要为来源原文(英文),暂无官方中文版本。
我们近期的结果表明,Nemotron 是构建世界级专家模型的强大且可适配的基础。从 Nemotron 3 开始,我们的团队使用监督微调(SFT)、强化学习(RL)和反馈驱动的推理,打造出在 IMO 2026 和 IOI 上均达到金牌水平的系统……
结构化输出是大语言模型最常见的现实任务之一,然而大多数基准测试将其归入更广泛的推理或提取分数中,而不是单独衡量。模型能否可靠地返回符合请求格式和形状的有效、可解析输出(即模式合规性),往往决定了它是否能被实际使用。
我们的最新论文《量化感知修复:恢复压缩4位LLM的实用配方》提出了一个该领域大多未触及的问题:当一个模型已经经历了结构性压缩(不仅仅是量化)后,这种恢复步骤实际上效果如何,以及正确的方法是什么?
微调多向量模型涉及多个组件:模型本身、数据集、损失函数、训练参数、评估器和训练器类。我将逐一检查这些组件,并附上用于微调强大多向量模型的实用示例。
知识蒸馏——训练较小的学生模型以匹配较大教师模型的性能——是机器学习中众所周知的技术。随着最近一波开源大语言模型(如gpt-oss、Qwen、GLM或Kimi)的出现,它再次成为主流研究课题。部署这些……