Transformers
预训练模型工具库,覆盖文本、视觉、音频与多模态任务。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 8 条
预训练模型工具库,覆盖文本、视觉、音频与多模态任务。
生物学并非孤立运作,其 AI 表征也不应如此。Quine 是一项早期研究项目,旨在构建生物学的多模态世界模型。通过连接跨生物尺度和模态的洞见,Quine 帮助科学家以计算方式搜索一个远超直觉所能及的空间……
我们去年推出了 EmbeddingGemma,旨在为高质量文本嵌入提供一种轻量级选择,帮助你的应用直接在消费级硬件上组织、搜索和连接信息。开发者社区的反馈远超我们的预期。其下载量已超过 2000 万次,构建者们已将其用…
今天,我们推出Gemma 4 12B,这是我们最新的模型,旨在将智能体多模态智能直接带到笔记本电脑上。Gemma 4 12B在边缘友好的E4B和更先进的26B专家混合(MoE)之间架起桥梁,将强大的功能封装在更小的内存占用中。它也是我们…
推测解码如何用于 VLM?视觉草稿模型采用与我们的文本 LFM2.5-DSpark 草稿模型相同的架构:它在固定的一组被选层捕获目标模型的隐藏状态,并以此为条件草拟一个包含 k 个候选 token 的块。图像 patch 和文本 token 被投影到一个 sh…
我们如何为边缘构建决策模型:这些开放的 d1 决策模型基于我们的 Liquid Foundation Models(LFMs)构建。与我们的生成式模型不同,决策模型不生成 token,而是在单次前向传播中给出答案。
TL;DR 我们推出了 NeoMME,一个包含 260M 和 800M 参数的多语言多模态编码器家族。与许多生成式视觉语言模型不同,NeoMME 不使用单独的预训练视觉塔或因果语言模型。一个单一的双向 Transformer 同时处理文本标记和原始图像块,并且我们训练...
为庆祝这一时刻,我们在transformers、llama.cpp、vLLM、Inference Endpoints及其他库中提供了Meta的day-0支持。我们构建了一些有趣的功能,并在本博客中分享了我们的发现。