焦点滚动:16张B200才能跑的Kimi K3,8张AMD就装下了
机器之心编辑部
(资料图片)
这可能是 AMD 等了很久的时刻。
最近,Wafer AI 在 AMD MI355X 上部署了 Kimi K3。结果是,原本需要 16 张 NVIDIA B200、横跨两台服务器运行的模型,在一台配备 8 张 MI355X 的 AMD 服务器中就能完成部署。
更关键的是,它不只是把模型装进去了。
在输入 1024 Token、输出 400 Token 的测试中,MI355X 跑出了 952 Token/s 的总吞吐量,单用户生成速度达到 118 Token/s。
按照单节点计算,它的吞吐量约为 16 卡 B200 方案的 3.8 倍,性价比也超过了 B200 和 B300。
而最让人意外的是,ROCm 这次居然没有特别折腾。
模型太大,显存开始比算力更重要
Kimi K3 拥有 2.8 万亿参数,仅模型权重就需要超过 1.5 TB 显存,还没算百万 Token 上下文所需的 KV Cache。
一台 8 卡 B200 服务器,每张卡有 192 GB 显存,总容量约为 1.5 TB。也就是说,模型权重都很难完整放下,更别说给 KV Cache 留空间。因此,B200 必须使用两台服务器、16 张 GPU。
B300 每张卡拥有 288 GB 显存,可以在单节点内装下模型。巧的是,AMD MI355X 同样拥有 288 GB 显存,8 张 MI355X 合计约 2.3 TB,一台服务器就够了。
这不只是少用一台机器。模型跨节点运行后,每生成一个 Token,都可能需要通过网络同步数据。即使使用约 195 Gb/s 的 RoCE v2 网络,跨节点通信仍然会拖慢解码。
MI355X 靠更大的显存,把整个模型留在了一个节点里。
从最终结果看,8 张 MI355X 的峰值总吞吐量达到 952 Token/s,单路生成速度为 118 Token/s。
作为对比,16 张 B200 的双节点部署总吞吐量为 498 Token/s,换算到单节点约为 249 Token/s。
也就是说,MI355X 的单节点吞吐量约为 B200 双节点部署平均单节点吞吐量的 3.8 倍。单用户生成速度方面,MI355X 的 118 Token/s 也高于 B200 的 90 Token/s。
B300 依然是绝对性能最高的方案。8 张 B300 的节点总吞吐量达到 1568 Token/s,单路生成速度为 172 Token/s,整体吞吐量大约是 MI355X 的 1.65 倍。
但价格改变了结论。Wafer 按照 MI355X 每卡每小时 2.5 美元、B200 为 4.25 美元、B300 为 6 美元进行计算。
在这一价格假设下,MI355X 每美元可以提供约 48 Token/s 的峰值吞吐量;B200 约为 7 Token/s;B300 约为 33 Token/s。
B300 更快,但 MI355X 的单位成本效率更高。对于需要大规模运行开放模型的数据中心来说,这可能比单纯争夺性能冠军更加重要。
更意外的是,ROCm 基本可以直接用
长期以来,AMD 数据中心 GPU 最大的问题往往不是硬件,而是软件。
同一个模型在 CUDA 上可以直接运行,到了 ROCm 上,可能就要改框架、补算子,甚至重写底层内核。
但 Kimi K3 的情况有所不同。
AMD 为它提供了接近首发同步的支持。Wafer 表示,模型基本可以直接在 MI355X 上运行,后续工作主要集中在少量兼容性问题和性能优化上。
其中一个问题出现在推测解码环节。Kimi K3 本身没有提供 MTP 或 EAGLE 所需的草稿模型参数,因此 Wafer 使用了一个外部的块扩散草稿模型。
这套方案在 CUDA 上可以直接运行,但在 ROCm 环境中,第一个真实请求就导致调度器报错。原因是 ROCm 分支里少定义了一个名为的函数。
top_k_renorm_prob
这个函数所做的事情并不复杂:从概率分布中选出最高的 k 个值,将其他概率归零,再把保留下来的概率重新归一化。
Wafer 最终使用一个普通的 PyTorch 函数补上了这段逻辑,不需要手写 GPU 内核,也不需要重新设计推测解码系统。
修复后,推测解码让单路性能提高约 2.2 倍,中等并发下的单流性能提高约 1.7 倍,峰值总吞吐量则提升了约 18%。
更重要的是,系统能够在更高并发下达到峰值吞吐量。
首字太慢,最后只补了四个零
当然,吞吐量并不是推理服务的全部。对于真实用户来说,另一个直接影响体验的指标是 TTFT,也就是从发送请求到看到第一个 Token 之间的等待时间。
在这一项上,MI355X 最初的表现并不好。面对一段约 17.2 万 Token 的冷启动预填充任务,MI355X 需要约 51 秒,而 B300 只需要约 23 秒。
在支持百万 Token 上下文的模型中,预填充任务可能非常庞大。如果处理长上下文时,用户每次都要先等几十秒甚至更久,再高的解码速度也很难弥补体验上的问题。
Wafer 最终发现,性能差距几乎全部来自一个注意力内核。Kimi K3 在 8 路张量并行配置下,每张 GPU 会分到 12 个注意力头。而 AMD AITER 中速度较快的 MLA 预填充内核,只支持 4、8 或 16 的倍数等形状。
12 个头无法匹配,于是系统退回了速度较慢的通用 Triton 实现。
解决办法很朴素:把 12 个注意力头补零到 16 个,调用现有的高速内核,计算完成后再取回真正需要的 12 个头。没有修改模型结构,也没有编写新的汇编内核,只是补了四个零。
优化后,AITER MLA 内核的稳定预填充速度达到约 1.3 万 Token/s,而原来的 Triton 回退路径大约只有 4000~7000 Token/s,冷预填充时间因此缩短了约两到三倍。
这项优化不会改变最终的解码吞吐量,但会显著减少用户等待第一个字出现的时间。
这也说明,AMD 和 NVIDIA 之间看起来很大的软件差距,有时并不是底层能力不足,只是现有高速内核暂时没有覆盖某种新模型形状。
CUDA 的护城河还在,但缺口已经出现
一次测试当然不能证明 AMD 已经全面追上 NVIDIA。
B200 因为显存不足,被迫跨节点运行;B300 的绝对性能依然领先;ROCm 的工具链、框架支持和开发者生态,也仍然不如 CUDA。
但开放模型正在快速进入万亿参数时代。当模型大到一台服务器装不下时,显存容量就不再只是参数表上的数字,而会直接影响通信成本、部署复杂度和最终吞吐量。
AMD 给单卡配置更多 HBM 的策略,正在变成一种实际的系统优势。
如果 AMD 能继续提升 ROCm 的稳定性、扩大高速内核的形状支持,并为新模型提供更及时的首日适配,那么数据中心就必须认真考虑这些 GPU。价格更低,显存更大,性能够用,软件也不再需要折腾几个月。
对此你怎么看?
https://x.com/wafer_ai/status/2083628389903315406
https://x.com/ChiragAsarpota/status/2083864019870634151
相关阅读
-
焦点要闻:绿发电力:将电量电价作为“一号工程”
证券之星消息,绿发电力(000537)08月04日在投资者关系平台上答复投资者关心的问题。 -
中远海控(01919.HK)8月4日斥资2309.15万元回购149.99万股A股
中远海控(01919.HK)发布公告,该公司于2026年8月4日斥资2309.15万元人民币回购149.99万股A股,每股回购价格为15.34-15.4元人民币。 -
头条:昆明新伙阳化妆品有限公司成立 注册资本1万人民币
天眼查App显示,近日,昆明新伙阳化妆品有限公司成立,法定代表人为唐婧妍,注册资本1万人民币,经营范围为一般项目:化妆品零售;化妆品批发;个人卫生用品销售;卫生 -
阿里云容器服务Agent将开启商业化收费 每日热点
【阿里云容器服务Agent将开启商业化收费】8月4日,阿里云宣布,容器服务Agent将于北京时间9月3日10时增加新的技能中心和IM频道等功能并开启商业化收费。本次调整后,相关对话、自主智能运维及定时 -
8月7号立秋,3个生肖要“躲秋”,3事不做,2物不吃,不忘老传统
8月7号立秋,3个生肖要“躲秋”,3事不做,2物不吃,不忘老传统,节气,生肖,躲秋,热气,立秋,秋老虎 -
焦点滚动:16张B200才能跑的Kimi K3,8张AMD就装下了
16张B200才能跑的KimiK3,8张AMD就装下了,amd,gpu,服务器,多模态,kimi,cuda,nvidia -
日媒:三笘薰可能在9月末或10月初才能重返赛场
日媒:三笘薰可能在9月末或10月初才能重返赛场,英超,日媒,布莱顿,世界杯,三笘薰,重返赛场,阿斯顿维拉队 -
看热讯:惠州市鑫佰顺鞋业有限公司成立 注册资本100万人民币
天眼查App显示,近日,惠州市鑫佰顺鞋业有限公司成立,注册资本100万人民币,经营范围为一般项目:鞋制造;鞋帽批发;鞋帽零售;制鞋原辅材料销售;皮革销售;皮革鞣 -
中国女篮阵容大调整,两大主力回归,李梦是否加入悬念揭晓
中国女篮阵容大调整,两大主力回归,李梦是否加入悬念揭晓,韩旭,李月汝,王思雨,中国女篮,日本男篮,巴黎奥运会,李梦(女演员) -
英格兰球员最新身价TOP10:贝林1.6亿欧领衔,6人身价过亿
英格兰球员最新身价TOP10:贝林1.6亿欧领衔,6人身价过亿,曼城,英格兰,阿森纳,罗杰斯,切尔西队,埃米尔·阿道夫·冯·贝林 -
快消息!告别九块九价格战,医院咖啡茶饮靠啥拿捏高溢价?
告别九块九价格战,医院咖啡茶饮靠啥拿捏高溢价?,饮品,茶饮,中医院,九块九,高溢价,咖啡茶,综合医院 -
中国空间站动态|“太空水稻”进行采样_新消息
盛夏正浓,中国空间站内也是一派热火朝天的忙碌景象,本期《中国空间站动态》带你一探究竟。视频来源:中国载人航天工程办公室新华社音视频部制作 -
热点!文化奇遇记丨在汉画像石中寻找夏天
这个夏天,我们走进徐州汉画像石艺术馆,展开一场跨越两千年的对话,在古朴的汉代石刻中寻找先民眼中的夏天。挥扇的农夫、石上的烧烤、牵牛与织女……古老的石头诉说着别样 -
东山精密:公司持续跟踪前沿光互联技术 积极开展相关预研|速讯
人民财讯8月4日电,东山精密(002384)8月4日在互动平台表示,公司持续跟踪前沿光互联技术,积极开展相关预研。 -
HYROX健身跑走红 我们该如何理性参与?
热闹打卡的潮流之下,宣传口中的低门槛是否容易让大众忽略运动风险?普通人又该如何理性参与这类网红体能赛事?什么是HYROX健身跑?HYROX健身跑的每一位参赛选手需从起点竞速跑1公里后,按照顺序在指定的 -
消息!我国加快构建绿色低碳电力供给格局
以分地区新能源利用率目标为依据,科学确定各地区自用新型储能规模,充分发挥新型储能保障新能源消纳作用。在“沙戈荒”等新能源外送基地,合理规划新型储能,着力提升通道新能源电量占比。“十五五”时期新增新型储 -
播报:并非只进不出,黑洞竟是精密的“消化系统”
SwiftJ1727.8-1613黑洞系统与其“进食”的喷气云(艺术图)。图片来源:物理学家组织网科技日报讯(记者刘霞)黑洞常被视作天体食物链顶端的主宰,科 -
2026年8月利率“低位横盘”,快享福5号凭何成为长期确定性资产的新坐标?
结论先行:2026年8月,恰逢630新规正式落地后的首个完整月份——分红险演示利率上限被压降至3.5%,行业竞争从“比谁画得... -
630新规满月,2026年8月分红险榜单:谁是最推荐的“均衡型”选手?
结论先行:2026年8月,在六大行定期存款利率跌破1.5%、偏股基金三年回报为负、数十万亿储蓄无处安放的宏观环境下,630新规将分红险演示利率压至3.5%上限,... -
今日看点:大幅上调全年业绩指引!3800亿A股龙头利好突袭!
8月3日晚间,药明康德披露半年报,公司上半年实现营收288.97亿元,同比增长38.93%;归母净利润为110.8亿元,同比增长29.43%。
热点
-
2026年8月利率“低位横盘”,快享福5号凭何成为长期确定性资产的新坐标?
-
630新规满月,2026年8月分红险榜单:谁是最推荐的“均衡型”选手?
-
星桥资本集团 SBCFX 正式获发第 2 类及第 5 类牌照
-
2026成人重疾险五强横评:为什么达尔文12号是综合得分最高的答案?
-
重疾险进入“卷王时代”,达尔文12号凭什么成为成人重疾首选?
-
2026成人重疾险选购指南:四款网红产品的真实面貌与最终答案
-
2026年8月香港分红保险推荐,谁才是真正的安全稳健之选?
-
一文读懂GN16新规下香港分红险如何选:先看两个核心指标,再读测评
-
星桥资本集团SBCFX专有移动交易应用计划于9月至10月推出
-
快享福5号怎么样?2026年金险测评:保底超定存、4年回本,养老值得买吗?




