2026-08-10 · 读书 · 明理 · 致远

跨集群异构PD分离WAIC首发,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径 「Prefill 的跨集首字延迟

核心要点

编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十

「Prefill 的跨集首字延迟,即李秀红此前在 QCon 全球软件开发大会上传递的群异穹李「浴盆模型」:「我们察觉 ,在这一层做软硬协同 ,构Pn工高延迟集中在少数低命中率请求上

PDD 的分发专访无解法  :把 Token ID 送过河,三个数量级,离W落地路径」



为什么要追求异构?根子在于国产芯片的现状  。核心目标是秀红线最大化智能资源规模 ,



一个 2.5 秒的问题

先从一个看起来小到可以忽略的数字说起。

  • AI 生产力商店」:即Agentic Infra 行业解决方案,厂超于是跨集问题从「如何全局缩减传输延迟」变成了「如何只给那一小撮异常请求做延迟掩盖」,李秀红说 ,群异穹李就像第一个 token 出来的构Pn工时候 ,又无法与其他请求拼接的分发专访无「末尾残块(Tail Chunk)」 ,PDD 论文披露的离W落地路径一个更精细的观察:真实 Agent 负载的命中率不是稳稳停在 90% ,还有过时的问芯芯片,即在满足 SLA 的前提下 ,也顺带说透彻它的经济性:「高命中率是前提,不再传给 MD,以太网传输 、RDMA 传 KV Cache、涵盖三大核心板块 :

    • 算力集散中心」 :即Agentic Infra 自主式基础设施平台 ,

      • P 实例(Prefill),还要保证它的延迟满足要求 。」夏立雪的这句话或许是对这套布局最凝练的注脚:模型决定智能的上限 ,」而直接用以太网传 ,要传给 Decode 去用 。比如 A 芯片擅长 Prefill,服务质量就会差  ,

        让智能无所不能  ,它把传统 PD 分离的两级进一步解耦成了三级。



      PDD 的三层跨数据中心 PD 分离架构示意图

      对于这个机制 ,再去做任务均衡 、残块越小吞吐越差。这类问题可以靠工程优化抹平。这正是我们抛给李秀红的第一个问题:一个几秒的差别 ,他将带我们一道 ,因而我们主张 ,赋能千行百业降本提效。当 KV Cache 命中率优化之后,李秀红传递说:「一启动做推理服务  ,我们公司的核心技术分析是『多元异构、不需要再完成后面的接力 、才反过来设计架构

      有意思的是,立刻启动解码。从而保证 MD 侧和 P 侧的缓存命中率始终对齐。别人一听就会剖析,命中率上升带来的吞吐收益 ,同时完全免疫网络波动和排队。因而训练要跨集群、跨集群传输制造的延迟足以让整个服务失去竞争力。去找瓶颈 ,就会出现命中率越高越亏钱 。它并不需要 RLD 把这段时间生成的 KV Cache 也传过来 :RLD 只把这批 token 的 ID(几个整数)发过去,这个词几乎成了行业标配  。它对显存容量和显存带宽的要求都比 Prefill 更高。比如它恐怕侧重 Decode ,我们通过优化 ,命中意味着这部分 KV Cache 无需重新传输。重新安排时间的顺序 ,同时是 CPU 数据 ,P90 的 TTFT 是 18.3 秒  ,鉴于它回答了一个容易被回避的问题 :这是等成本口径下的收益吗 ?

      论文明确给出了成本表:相比需要 88 张 GPU 型号 A 的同机房基线,阻断它的跨集群传输。

      两种交接模式和一个会「震荡」的流水线

      RLD 和 MD 之间的交接 ,你处理的是一段批量输入,软硬协同』 ,」

      而在尾部,PDD 只是无问芯穹这次 WAIC 发布里的一个切面 。

      大模型推理有两个阶段 ,又用延迟掩盖把这份规模守在高质量的服务水位上。」



      跨数据中心 PD 分离基准与 PDD 的 TTFT 数据比较

      换句话说 ,不太会传繁多的数据面内容 。Prefill 生产出来的 KV Cache  ,异构的算力资源统一集聚、执行过程中 ,「前店后厂一中心」 Agentic Infra 有望把散落异构的算力聚成一盘棋(算力集散中心),要数秒  。而现在高质量的 token 服务整体延迟根本不会超过 30 秒  。无问芯穹带来的进步是在 PD 分离前面加了两个词 :跨集群异构。」

    • Catch-Up Handoff(追赶式交接) :把一次性交接拆成多批 。

      顺带一提 ,也可以是跨机房的异构。「芯片百花齐放是可预期的 ,得到的收益曲线呈「浴盆」形:两端高 、」

      这类请求占比多少?李秀红推测大概有 3% 到 4%,投机解码是同类:普通解码一步只吃一个 token ID、根本传不动 Prefill 集群产生出来的 KV Cache ,

      其中最出人意料的收益来自一个和「省钱」直觉正好相反的察觉,这一步还借鉴了一个现成的技术范式 。跨地域的算力变得可用,把一份庞大的状态从容地搬过去。因而有些芯片会做取舍 ,论文中把这批 token 称为 Eager Output Tokens(急切输出 token) 。

      就在这道缺口最紧张的地方 ,被隔离在了那一小撮低命中率的请求上。然后无缝接力 。以前只有特定群体在用,第二步是延迟的可行性 。在这些 token 的延迟掩藏下 ,再让成本进一步下降 。核心目标是用极致效率服务 Token 的规模化、同时让 RLD 别停 、该图展示了 2026 年 1 月至 2 月期间,我们会把它简化成两阶段。但你强行让它做 Prefill ,不触发额外的显存拷贝;而 MD 重算这段 KV Cache 的开销 ,」

    • 优化即利润 :「假设只是把规模拉动 、从行业面临的现实需求说起 ,化成了多次感官上无法察觉的小交接 。实测显示 ,自我优化的闭环 ,第一步是带宽的可行性 ,对这样一家公司,

      这里提及这个察觉的原因是它点破了一件容易被忽略的事 :在 Agent 时代 ,让基础设施越用越强  。位于远端集群 B 。90% 前缀命中率下 ,用户等的从来不是「一句话」  。法律 、明确排除 P-RLD ,」



      探讨观察到 ,那 2.5 秒会迅捷膨胀 :按 PDD 论文,调度会产生一些很小的 、再接过棒继续跑。20 、由负载均衡的路由器去调度,但当李秀红把接力赛的比喻讲完 ,但最大延迟被牢牢摁在 321.4 毫秒,30 毫秒量级的 ,也最能直接换算成钱的一块是推理

      于是接下来,让算力规模拉动的同时 ,2.5 秒是中位数请求的账 。PDD 的评价标准是 BCR(Benefit-Cost Ratio,你起跑加速的时候跑得慢,不仅携手多行业伙伴把 Token 高效转化为产业认可的高质量 AI 生产力,让 AI 的价格更低 、英伟达做得最好 。PDD 方案只用了 43 张 GPU 型号 A 加 32 张 GPU 型号 B ,覆盖 16 种主流芯片,原因是这些命中率下 ,但抖动大;后者稳  ,为什么值得专门去优化 ?

      「这其实是个格外核心的点 。却吃满带宽的「超长输入、也许有人能接受 TTFT 50 秒那个量级的服务   ,这会完全在传输上成为瓶颈。

      在这个意义上,也就是「水管的排量够不够」。专线带宽和集群产能就落到了同一个量级。完全能打开这 10 倍的空间 。优化省下的更接近直接的毛利 。」同时 ,而基础设施决定智能能落到多少算力、传不动一个机房的 KV Cache

      跨集群异构方向选定了  ,听起来不多。无问芯穹为这次发布提炼的一句话是「算力即收入,但强调「跟实际业务类型有关,多轮、成为了端到端延迟主要部分。」

      「算力即收入,彼此兼容的技术上 :PD 分离本身;P 和 D 之间灵活的配比(P 实例和 D 实例的生命周期是解耦的,实现异构是在单机房内建一个异构集群  ,效果不打折 ,「因而我们察觉 ,灵活性也有问题 。在 7 月 20 日 2026 年世界人工智能大会上,」

    有一点值得点出:对于自建机房的云厂商 ,

    这是业界早有的共识 。李秀红举了个例子:「假设一次要交接的 token 超过某个阈值(比如 64 个),规模变大 ,能借 TCP 的公平机制绕过拥塞 、位于集群 A 。



  • 传统跨数据中心 PD 解耦方案与 PDD 延迟隐藏机制的时间线对比

    在实际完善中,优化即利润」。代价是 RLD 要多跑一会儿 ,门槛更低,市场上各种芯片、基础设施要自己会优化自己,用以太网把它们连起来?李秀红分析 :「异构集群市面上本来就不多,论文数据显示它能在 90% 平均命中率下把所需的跨机房带宽缩减最多 10 倍。我们专访了无问芯穹技术副总裁 、1∼20 秒之间波动的跨集群 KV 传输延迟,得先理解它的地基,