Hugging Face Datasets
数据集加载与处理库,任务边界清晰,是 Hugging Face 生态里最好入门的仓库之一。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按机构浏览
共 67 条
数据集加载与处理库,任务边界清晰,是 Hugging Face 生态里最好入门的仓库之一。
机器学习演示界面库,前端与 Python 两侧都有新手任务。
预训练模型工具库,覆盖文本、视觉、音频与多模态任务。
Hugging Face 官方发布的开源模型、工具和社区技术动态。
在台上这很尴尬。在生产环境中,这是一个可靠性问题:一个曾经成功的工作流,在用户下一次发出相同请求时可能会失败。对于关键任务,例如核对金融交易或检查合同中的义务,这可能成为阻碍。
向表格基础模型的转变 表格数据是企业机器学习的支柱。客户记录、交易、传感器日志、理赔和订单都存在于表格中,从中预测流失、违约、需求或价格是工业界最常见的机器学习任务之一。二十年来,…
环境为 agent 提供任务,通过观测对其动作做出响应,并对结果进行评分。由此产生的奖励可以在评估期间衡量 agent 的表现,或在训练期间提供学习信号。关于这一交互循环的介绍,请参阅我们关于 environments 的博客文章。在 e…
随着模型变得更快、工作负载不断扩展,这种平衡开始发生转变。在超大规模数据集上训练、同时服务大量并发请求,或反复处理长输入,都会对tokenizer施加足够大的压力,以至于使模型得不到数据供给。
在你的笔记本电脑上运行 AI 模型已变得容易得多,llama.cpp 在其中发挥了重要作用。其推理引擎为 Ollama、LM Studio 和 Jan 等本地 AI 工具提供支持。与 MLX 等项目一道,它帮助本地推理成为日常使用的切实可行之选。
我们的最新论文《ProvenanceGuard:面向基于 MCP 的 LLM Agent 的来源感知事实性验证》(可在 Hugging Face 上阅读,同时也可在 arXiv 上查看)针对的正是这一空白。我们关注的失效模式是一种我们称为跨来源混淆的现象:某个主张在证据中的某处为真,但被归因到了错误…
LoRA support recently landed in TRL's AsyncGRPOTrainer with PR #7017 , and ships with TRL v1.14. The asynchronous trainer can now train an adapter instead of the full model, and it syncs only the LoRA adapter to vLLM. This post covers a real-world project built on top of it, where training and inference no longer shar…
标题与摘要为来源原文(英文),暂无官方中文版本。
推测解码如何用于 VLM?视觉草稿模型采用与我们的文本 LFM2.5-DSpark 草稿模型相同的架构:它在固定的一组被选层捕获目标模型的隐藏状态,并以此为条件草拟一个包含 k 个候选 token 的块。图像 patch 和文本 token 被投影到一个 sh…
然而,评估并未同步跟进:它仍然分散且缺乏标准化。黄金标准是人类偏好评分,例如 MOS 或 MUSHRA(关于指标的更多内容)。为此,若干基于竞技场的排行榜已成为社区有用的参考点:
阿拉伯语 WER:20.92% · 参数量:1.6B · 阿联酋阿拉伯语 WER(TII 评估):22.73%
图 1:ThinkingBox 让 agent 在隔离的 MCP 工具会话中运行,然后对其留下的终端后端状态和副作用进行评分。摘自我们的 ThinkingBox 论文。
企业需要能在自身环境中良好运作的智能体。他们要求这些智能体所做的工作,受制于其所使用的系统、所遵循的规则以及其数据的状态。一个模型可能具备广泛的能力,却仍难以应对某个特定环境:某个它处理不佳的工作流、某种组合……
官方来源未提供摘要,点开可查看原文。
今天我们发布 Olmo-core 3,这是我们用于开发大语言模型框架的一次重大升级,其特点是重新设计了开放的混合专家(MoE)训练系统。
阿拉伯语实际上是一个名字下的一整个语族。现代标准阿拉伯语是你在新闻或教科书里读到的那种,但人们日常交谈时很少这么说话。在阿联酋,日常对话、幽默、谈判和讲故事都用阿联酋阿拉伯语,这是一种海湾方言,有自己的词汇……
MLX 是 Apple 用于本地 AI 的框架,特别针对 Apple Silicon 优化。自 2023 年 Awni 和 Angelos 将其作为圣诞礼物发布以来,我们一直是 MLX 的坚定支持者,并很自豪 HF Mirror 成为人们查找 MLX 模型并贡献自己的模型的 Hub。开放、本地 AI 的使用正在加速,我们相信 i…
我们近期的结果表明,Nemotron 是构建世界级专家模型的强大且可适配的基础。从 Nemotron 3 开始,我们的团队使用监督微调(SFT)、强化学习(RL)和反馈驱动的推理,打造出在 IMO 2026 和 IOI 上均达到金牌水平的系统……
语言模型已经可以帮助研究人员检索文献、综合证据并处理复杂问题。但科研工作对这些模型有特殊要求——答案需要始终以证据为依据,模型需要保留证据实际支持的内容,而不是悄悄地宽泛化……
我们如何为边缘构建决策模型:这些开放的 d1 决策模型基于我们的 Liquid Foundation Models(LFMs)构建。与我们的生成式模型不同,决策模型不生成 token,而是在单次前向传播中给出答案。
我如何 prompt ML Intern 1. 一个了解你领域的模型 2. 一个能画出你角色的模型 3. 一个会新把戏的模型 4. 一个适合你设备的模型 成本是多少 做你自己的 上周,我想要一个随 Qwen-Image 2.1 一起发布的 prompt 重写器的小型版本。官方版本是一个 9B 模型,需要大约…
Workflow1111 是一个由 73 个节点构建的 11 条媒体流水线组成的图。它汇集了用于文生图、高分辨率修复、图生图、提示词矩阵网格、VLM 图像理解、检测到修复掩码、ControlNet 风格标注器、背景移除、PNG Info 存储以及图生视频…的 SOTA 模型。
AISI 与 EvalEval 此前曾开展合作研究,该研究始于 NeurIPS 2025 期间的一场联合研讨会,来自该研究所的反馈帮助塑造了 Every Eval Ever(EEE)schema。合作的下一阶段将把这一共享基础设施付诸实践。
到目前为止,这些决策基于过时的经济学:一次一个定制模型,每个模型需要数月专家工作。因此,团队只对少数关键序列建模,并用安全边际、多余库存、多余容量和多余容差来覆盖其余部分,而这些措施在窗口关闭后才生效。这种边际...
结构化输出是大语言模型最常见的现实任务之一,然而大多数基准测试将其归入更广泛的推理或提取分数中,而不是单独衡量。模型能否可靠地返回符合请求格式和形状的有效、可解析输出(即模式合规性),往往决定了它是否能被实际使用。
原因之一是传统基准忽略了使语音系统在实践中的可靠性、自然性、上下文恰当性和有效性的许多条件和特性。因此,我们最近在Real World VoiceEQ、Open-ASR排行榜和远端语音ASR排行榜中引入了保留集……
实际部署很少符合话题级别的图景。同一个基础模型可能被适配用于通用助手、教育产品、企业系统或公共部门服务,每种场景在相同话题内需要不同边界。公民教育导师和公共部门助手可以共享一个模型……
DSpark如何工作?LLM推理中的解码阶段传统上是内存受限的。大部分延迟来自将权重从DRAM流入SRAM,而不是来自高强度计算。推测解码通过使用轻量级草稿模型生成候选令牌,然后由目标模型验证它们来解决此问题……
为庆祝这一时刻,我们在transformers、llama.cpp、vLLM、Inference Endpoints及其他库中提供了Meta的day-0支持。我们构建了一些有趣的功能,并在本博客中分享了我们的发现。
8月23日,Surya Narreddi 发布了一段由语言模型绘制水彩画的精美视频。该模型通过 p5.brush(一个为 p5.js 添加自然绘图工具的库)编写 JavaScript 代码。视频迅速走红,截至撰写本文时已有超过150万次观看。
今天我们推出 BenchMIRT,一种在单个提示级别(即模型被评分的具体问题和任务)审计 LLM 基准测试的新方法。
知识蒸馏——训练较小的学生模型以匹配较大教师模型的性能——是机器学习中众所周知的技术。随着最近一波开源大语言模型(如gpt-oss、Qwen、GLM或Kimi)的出现,它再次成为主流研究课题。部署这些……
我们的最新论文《量化感知修复:恢复压缩4位LLM的实用配方》提出了一个该领域大多未触及的问题:当一个模型已经经历了结构性压缩(不仅仅是量化)后,这种恢复步骤实际上效果如何,以及正确的方法是什么?
今年早些时候,《软件会遗忘:代理痕迹即记忆》一文指出,编程代理已经产生了我们不断丢失的记录。当它们搜索代码库、尝试不同方法、遇到错误、阅读文档并改变方向时,它们留下的不仅是更改了什么,还有为什么更改的丰富记录。
当用户听到您的应用响应时,您已经花费了宝贵的毫秒来捕获音频、转录音频、运行LLM、检索上下文并生成响应。文本转语音(TTS)是最后一步——也是用户最关注的一步。如果语音生成缓慢,整个体验就会受到影响。
给LLM代理一个现实中的多步骤任务——分摊账单、查找歌曲、在九个模拟应用中核对订单——当它失败时,通常不是因为缺乏知识。它可能错误地对API进行分页,识别错误的人,或者在未要求时返回值。模型知道API;但它没有的……
今天,我们发布了这项工作的第一部分:@huggingface/kernels,一个用于从 HF Mirror Hub 加载和运行优化 WebGPU 内核的精简库,同时提供了位于 hf-mirror.com/webgpu-kernels 的初始207个内核集合。
OlmoEarth Studio是我们用于构建地球观测模型的平台,现在支持计算和导出嵌入向量——即由我们的开源OlmoEarth基础模型生成的地球观测数据的紧凑数值表示。源代码和模型权重随研究论文公开提供……
普通嵌入模型将整个文本压缩为一个向量,而多向量模型为每个词元保留一个向量,并使用MaxSim算子计算查询与文档之间的匹配分数。这保留了单个向量必须平均掉的词元级匹配信息,这通常意味着在检索性能上更强。
世界基础模型提供了一条不同的路径。它们不是手动编写每个物体和物理交互,而是直接从同步视频和机器人运动学中学习视觉动态。NVIDIA的Cosmos-H-Surgical-Simulator通过从初始场景生成未来的手术视频来演示了这种方法……
您有一个智能体,可以记录演示并将其推送到Hugging Face Hub。现在您想持续运行该循环:全天收集数据,在增长的数据集上训练策略,部署它,然后拉取下一批数据以改进它。该循环运行一次,每个环节都能正常工作。但运行多次时……
在这篇博文中,我们分享了从这次黑客马拉松中学到的经验,以及这些经验对当智能体进行实验研究时人类角色意味着什么的启示。
TL;DR 我们推出了 NeoMME,一个包含 260M 和 800M 参数的多语言多模态编码器家族。与许多生成式视觉语言模型不同,NeoMME 不使用单独的预训练视觉塔或因果语言模型。一个单一的双向 Transformer 同时处理文本标记和原始图像块,并且我们训练...
时间序列基础模型正在改变预测系统的构建方式。用户无需为每个数据集训练和维护单独的模型,而是可以使用预训练模型进行零样本预测。
基准测试决定了什么会被构建。在开放ASR排行榜上得分高的模型会被采用并持续迭代,而排行榜未衡量的能力往往得不到改进。最近排行榜上的许多工作都投入在使评估指标更加可靠上:
我们构建了一个考虑约束的GPU分配器,并在七个基准测试场景中将其与FIFO调度器进行了对比。在相同的硬件上运行相同的工作负载,GPU利用率最高提升了33个百分点,且每个场景中的优先级加权输出都有所提升,最高提升105%。关于……
微调多向量模型涉及多个组件:模型本身、数据集、损失函数、训练参数、评估器和训练器类。我将逐一检查这些组件,并附上用于微调强大多向量模型的实用示例。
gr.Workflow直接集成在Gradio中,使流水线即界面。您将步骤描述为类型化节点的图,Gradio提供一个拖放画布,其中每个节点可运行,每个中间结果可见。同一图也是REST API,并可一键部署到HF Mirror Spaces。
为智能体配备代理记忆听起来很简单:从其过去的工作中提炼经验,将其放回上下文中,那么更多的经验应该意味着更好的性能。但实际情况并非总是如此。当我们将评估扩展到八个模型——从30B密集模型到前沿专有系统——我们发现了一个关键问题。
我们很高兴地宣布,Baseten现已成为HF Mirror Hub上受支持的推理提供商!
原因是结构性的。飞机的成本按日历小时累积:融资、折旧、机身保险、定期维护、机组合同。其收入仅按飞行小时产生。在地面上的每一小时都会缩小该方程式的输出侧,而成本侧则继续按……运行。
当然,让AI研究易于获取需要一个强大的搜索引擎,以便人类和代理能够快速找到相关和关联的工作,无论是通过网站还是 pwc 搜索命令行命令(代理可通过Skill使用该命令)。
我们的最新论文《LLM Compression by Block Removal with Constrained Binary Optimization》将这一对应关系落到实处。我们将模块选择重新表述为约束二元优化(CBO)问题,直接映射到Ising玻璃,一种具有全连接相互作用和固定数量的无序自旋系统……
我们发布此详细级别的原因在于,技术比事件本身更重要,因为它揭示了前沿代理的新兴攻击能力,它们可能被恶意行为者如何使用,以及每个人作为防御者应如何做好准备。
HF hub上的模型和数据集每天都在增长。期间,公开模型仓库从243万增长到296万,数据集从71.1万增长到100万,Spaces从100万增长到144万。底层分布仍然极端,约85.6%的模型终身下载量少于200次,1.5%……
TL;DR:Granite 4.2是我们第一个密集、仅解码器的推理LLM系列,提供三种规格:3B、8B和30B。每个模型从头开始预训练,使用约15万亿个令牌,采用五阶段策略,将上下文窗口扩展到512K令牌,并在思维链、推理和代理……上进行了监督微调。
但事实并非如此。大多数路由系统假设模型选择是一个分类问题。根据我们在智能体系统中构建路由的经验,看似模型选择的问题很快变成了一个系统优化问题。三个维度让我们觉得这出奇地困难。
这是PyTorch性能分析系列文章的第三篇,该系列旨在逐步培养阅读性能分析器跟踪的能力,并利用它来驱动优化:
语音正迅速成为AI的主要界面。从客户支持和医疗保健到教育、娱乐和个人助理,语音正日益取代文本,成为人们与AI互动的方式。
瓶颈不在于模型,而在于数据。机器人学习面临供给问题。我们有能力强大的策略架构(基于Transformer的VLA、扩散和流匹配策略,甚至世界模型)以及训练它们的GPU。我们所缺乏的是大规模、多样化、真实的操作数据。
Inkling是一个大型(1万亿参数!)开放模型,原生接受图像、文本和音频输入。
训练流水线分为两个阶段。第一阶段是监督微调,使用来自巴西葡萄牙语的不同来源、格式和复杂程度的大量文件。此阶段将模型权重与巴西葡萄牙语的特定词汇、句法和文档结构对齐。
我们发现了对一组有限的内部数据集以及我们服务使用的几个凭据的未授权访问。我们仍在完成对是否有合作伙伴或客户数据受影响的评估,并会根据需要直接联系任何受影响的方。我们没有发现任何篡改的证据……
这些后端大多是仅权重的。这意味着它们以低精度存储权重,并在计算时将其反量化回高精度。这显著减少了内存使用,但通常不会使推理更快,甚至可能增加少量延迟开销。