vLLM
大模型推理引擎,适合想弄清 KV cache 与批处理调度的人。
你好呀,正在用屏幕阅读器的朋友。这个网站的每个按钮和图片我都认真标注过,希望你逛得顺畅。有任何不方便的地方,页脚有我的邮箱,说了我就改。—— 店主
加载中…
按主题浏览
共 18 条
大模型推理引擎,适合想弄清 KV cache 与批处理调度的人。
除非安装了 vllm,否则无法导入 RankLLMRerank。即使所使用的后端与 vLLM 毫无关系,也依然如此。原因:llama_index.postprocessor.rankllm_rerank.base 在模块级别从 rank_llm.rerank 导入了 PromptMode 和 Reranker:在当前版本 0.25.7 中,从 rank_ll… 导入任何内容
3.0.3 从Airflow版本3.0.2升级到3.0.3后,在编辑连接页面中,额外字段和额外字段JSON中的敏感数据变得可见。在Airflow UI中,进入“编辑连接”窗口时,敏感数据应被掩码。Ubuntu 24.04 其他基于Docker的部署,Airflow使用Docker Swarm部署。设置见…
此问题用于跟踪重复出现的 Whisper 请求以及相关的正在进行中的支持工作的链接(如果有)。当某个功能请求没有关联的 PR 时,如果您愿意帮忙,可以在此处认领该工作! - 相关问题:https://github.com/vllm-project/vllm/issues/19556、https://github.com/vl…
了解 GPT-6 如何通过更高的缓存命中率、新的诊断功能、显式断点以及可降低延迟和成本的控制手段来改进提示缓存。
机器人正变得越来越智能,但它们的硬件如何跟上这种增长?Microsoft Research的新研究结果表明,将AI推理移出机器人本体可以提高任务成功率、提升效率,并支持更先进的物理AI工作负载。文章《面向真实世界物理AI机器人的卸载式推理》发表于……
LLM并不会仅仅因为记住更多而变得更聪明。EvoLib将经验转化为持续演化的知识,提取可复用的技能和洞察,帮助模型在部署后长期跨任务学习和适应。文章“EvoLib:将经验转化为持续演化的知识”首次出现在微软研究院。
了解OpenAI如何将Habitat从一个Python库演进为服务10亿ChatGPT用户、每秒处理2200万请求的全球分布式存储平台。
GPT-6 Astra是我们能力最强、部署最广泛的模型,也是我们在预备框架下首个达到网络安全能力关键水平的模型。
Kaggle与Google合作的AI Agents Intensive课程,以免费形式让学习者共同构建和部署AI的前沿应用。
Jalapeño是OpenAI的一款定制推理芯片,可提供更快、更节能的AI推理,为现代模型带来更高吞吐量和更低延迟。
DSpark如何工作?LLM推理中的解码阶段传统上是内存受限的。大部分延迟来自将权重从DRAM流入SRAM,而不是来自高强度计算。推测解码通过使用轻量级草稿模型生成候选令牌,然后由目标模型验证它们来解决此问题……
当用户听到您的应用响应时,您已经花费了宝贵的毫秒来捕获音频、转录音频、运行LLM、检索上下文并生成响应。文本转语音(TTS)是最后一步——也是用户最关注的一步。如果语音生成缓慢,整个体验就会受到影响。
您有一个智能体,可以记录演示并将其推送到Hugging Face Hub。现在您想持续运行该循环:全天收集数据,在增长的数据集上训练策略,部署它,然后拉取下一批数据以改进它。该循环运行一次,每个环节都能正常工作。但运行多次时……
gr.Workflow直接集成在Gradio中,使流水线即界面。您将步骤描述为类型化节点的图,Gradio提供一个拖放画布,其中每个节点可运行,每个中间结果可见。同一图也是REST API,并可一键部署到HF Mirror Spaces。
我们很高兴地宣布,Baseten现已成为HF Mirror Hub上受支持的推理提供商!
这些后端大多是仅权重的。这意味着它们以低精度存储权重,并在计算时将其反量化回高精度。这显著减少了内存使用,但通常不会使推理更快,甚至可能增加少量延迟开销。
当然,让AI研究易于获取需要一个强大的搜索引擎,以便人类和代理能够快速找到相关和关联的工作,无论是通过网站还是 pwc 搜索命令行命令(代理可通过Skill使用该命令)。