开源项目人工智能入门
[性能][内核] 在 W4A8-INT8 路径中采用 PTX 9.4 `ldmatrix.s8.s4`(硬件 INT4 到 INT8 扩展加载)
PTX ISA 9.4(CUDA 13.4.0 开发者预览版)引入了新的 ldmatrix 变体,在共享内存矩阵加载过程中执行打包 INT4 到 INT8 的即时符号扩展:源数据是密集打包的带符号 4 位元素;硬件在目标片段中将它们扩展为带符号的 8 位值。这可以消除对额外转换操作的需求,并可能提高 W4A8-INT8 量化路径的性能。此更改旨在利用硬件特性来优化内核,有望减少内存占用和计算开销。
vllm-project/vllm
继续探索
同方向条目
AI 动态人工智能
5种利用搜索提升学习的新方法
以下是如何使用谷歌搜索工具学习课程和准备标准化考试。
Google发布于 2026年8月20日
官方来源 · Google AI核验于 2026年8月28日
AI 动态人工智能
通过Gemini和Pixel更贴近比赛
Google Gemini和Pixel与五家全球足球俱乐部合作,通过AI和智能手机技术提升球迷的赛日体验。
Google发布于 2026年8月17日
官方来源 · Google AI核验于 2026年8月28日
AI 动态人工智能
AMIE,我们的研究型医学AI系统,在一项首创研究中展示了实时临床视频咨询能力。
谷歌在模拟环境中推出AMIE,用于实时临床视频咨询。
Google发布于 2026年8月12日
官方来源 · Google AI核验于 2026年8月28日
AI 动态人工智能
扩展Gemini API中的托管代理:后台任务、远程MCP等
我们宣布Gemini API中托管代理的新功能,使开发者能够构建可靠的生产级代理。
Google发布于 2026年7月7日
官方来源 · Google AI核验于 2026年8月28日