摘要
随着推理大模型、长上下文和智能体应用持续发展,推理系统的主要矛盾正由峰值计算能力不足转向模型权重、键值缓存、专家参数与中间状态在多级存储和互连网络中的高频迁移。针对现有研究分别从算子、量化、缓存、调度或芯片角度开展优化而缺少统一分析尺度的问题,文章构建“工作负载—状态对象—存储层级—数据运动—服务目标”五维分析框架,并提出面向Token生成的容量—带宽—时延—能耗联合模型。研究表明:①预填充与解码阶段的算术强度、状态生命周期及服务目标显著不同,单一硬件配置难以同时取得最优结果;②低比特微缩放、KV缓存压缩和稀疏保留能够减少传输字节,但其收益取决于格式转换、精度恢复与可逆性成本;③预填充—解码分离、全局KV缓存、CXL内存池和近存计算正在把KV缓存由设备内临时数据提升为可独立调度的系统状态;④未来高效推理架构应围绕状态价值实施预测放置、可逆压缩、通信计算重叠和异构Chiplet协同,而不能仅增加矩阵计算单元。文章进一步给出模型化容量算例、Token Roofline方法及可复现评价指标,为大模型芯片、编译器和推理服务系统的联合设计提供分析依据。
Transformer通过自注意力建立长距离依赖,推动了大语言模型的规模化发展[1]。然而,推理阶段与训练阶段并不共享同一性能规律:训练通常依赖大批量矩阵计算,而在线推理既要处理计算密集的预填充,又要处理低批量、强序列依赖的自回归解码[2]。推理模型进一步延长输出链路,多轮智能体还会反复加载系统提示词、工具定义、检索证据和历史状态[3],使“把模型放入显存”不再等同于“高效运行模型”。Ma和Patterson[4]把下一代推理硬件的关键机会概括为高带宽闪存、近存计算、三维存储—逻辑堆叠和低时延互连,其共同指向同一事实:算力增长快于内存容量、带宽和数据移动效率。基于此,文章不把GPU、NPU、CXL、PIM或Chiplet视为孤立技术,而从Token生成所需状态的生命周期出发,分析数据在片上SRAM、HBM、主机DDR、CXL内存、NVMe及远端节点之间的产生、驻留、复用、压缩和迁移机制,进而讨论内存中心化架构的形成逻辑、技术边界与未来路线。
1 技术演进与研究边界
1.1 从计算图优化到I/O感知算子
早期Transformer优化主要围绕矩阵乘法并行化展开,但标准注意力需要显式构造或反复访问规模为 的中间矩阵,其中 为序列长度。FlashAttention依据片上存储容量对查询、键和值进行分块,通过在线Softmax消除大规模中间矩阵在HBM中的物化,将算法复杂度不变的“精确注意力”重写为I/O感知算法[5]。FlashAttention-2进一步调整线程块和Warp之间的工作划分,减少非矩阵运算并提高并行度[6];FlashAttention-3利用异步执行、Warp专门化与FP8路径适配Hopper类硬件[7];FlashAttention-4则针对矩阵单元、共享内存和指数运算单元非对称扩展后的新瓶颈,联合重构流水线、Softmax缩放和工作块调度[8]。这一演进说明:即使数学表达式不变,最优实现也会随存储层级、专用单元比例和指令语义变化,算子优化本质上是数据驻留时间和访问次数的重写。
1.2 从连续批处理到分页式状态管理
在线服务的第二条主线是把请求调度与KV缓存管理结合。Orca采用迭代级调度,将完成一个解码步的请求重新组织成动态批次,避免请求级批处理造成的长尾等待[9]。PagedAttention借鉴虚拟内存分页思想,把逻辑连续的KV缓存映射为非连续物理块,降低预留和碎片浪费,并支持块级共享[10]。vAttention进一步利用GPU虚拟内存机制维持连续虚拟地址,在不改写注意力内核数据布局的情况下按需提交物理内存[11]。SGLang通过RadixAttention组织共享前缀,使系统提示词、检索文档和多分支生成之间的KV状态能够进行树状复用[12]。这些工作共同完成了一个重要转变:KV缓存不再只是注意力算子的内部张量,而成为具有地址、所有权、引用计数和淘汰策略的运行时对象。
1.3 从设备内优化到资源解耦
预填充阶段通常具有更高算术强度,适合大批量GEMM;解码阶段则需要逐Token读取权重和历史KV,易受内存带宽与尾延迟约束。Sarathi-Serve用分块预填充构造更均匀的混合批次,在不长时间阻塞解码的前提下提高计算利用率[13]。DistServe将预填充与解码部署到不同GPU池,并围绕TTFT与TPOT分别规划资源和并行方式[14];Splitwise从集群资源比例与成本角度论证阶段解耦的价值[15];Mooncake进一步建立跨GPU、CPU、DRAM、SSD和网卡的全局KV缓存,使“计算节点”和“状态节点”可以独立扩缩容[16]。NanoFlow把算子、请求与设备流水线进行细粒度重叠,显示单一层级的优化已难以覆盖端到端服务路径[17]。

图1 大模型推理内存技术的演进脉络
1.4 文章的分析边界
内存中心化并不意味着所有计算都应迁移到内存,也不意味着容量越大越好。它强调三点:①以状态对象而非设备边界组织系统;②以数据移动而非峰值FLOPS解释瓶颈;③以服务目标约束架构选择。文章讨论的对象包括密集模型、分组查询注意力模型、混合专家模型、长链推理模型和智能体工作流;技术范围覆盖GPU/NPU运行时、低比特表示、KV缓存管理、CXL分层内存、PIM/NDP、Chiplet互连及评价方法。训练阶段、参数更新一致性和大规模训练通信仅在与推理共用技术时涉及。
2 推理工作负载与内存墙
2.1 预填充与解码的非对称性
设批量为 ,输入长度为 ,已生成长度为 ,隐藏维度为 。预填充可将 个Token并行送入矩阵乘法,权重读取能够在Token之间摊销,矩阵计算通常具有较高算术强度;解码每轮只为每个请求产生少量Token,矩阵乘法退化为小批量GEMM或GEMV,权重和KV读取占比上升。对于单层注意力,解码步既要计算当前查询与历史键的点积,也要用注意力概率聚合历史值,其访存量随已保留上下文近似线性增长。图2给出阶段、状态对象和数据通路之间的关系。

图2 大模型推理阶段、状态对象与数据通路
把端到端时延拆分,可写为:
式中, 为排队时延, 为外部工具执行时延, 为跨层级或跨节点状态传输时延。仅优化核函数不能保证式(1)下降,因为核函数加速可能被排队、KV迁移或同步开销抵消;同样,扩大批量虽然能够摊销权重读取,却可能提高TPOT和P99尾延迟。因而,评价“更快”必须同时给出负载分布、服务目标和资源配置。
表1 典型推理工作负载及其主导瓶颈
| 工作负载 | 输入/输出特征 | 主要可复用状态 | 主导瓶颈 | 优先指标 |
|---|---|---|---|---|
| 短对话 | 短输入、短输出、并发高 | 系统提示词 | 权重带宽、调度开销 | TPOT、Goodput |
| 检索增强生成 | 长输入、中等输出 | 文档前缀、检索证据 | 预填充计算、前缀装载 | TTFT、缓存命中率 |
| 长链推理 | 中等输入、长输出 | 全量KV、验证状态 | KV容量与带宽 | TPOT、J/Token、正确率 |
| 代码与文档代理 | 长输入、长历史、工具调用 | 工具定义、文件片段、历史结果 | KV迁移、跨轮次复用 | 任务成功率、P99 |
| MoE服务 | 路由稀疏、专家热度偏斜 | 热门专家、路由统计 | 专家权重搬运、互连拥塞 | 吞吐率、负载均衡度 |
| 端侧推理 | 小批量、功耗受限 | 权重、局部KV | 容量、热设计功耗 | 能效、持续性能 |
2.2 状态对象的生命周期差异
推理系统至少包含六类状态。第一类是模型权重,其体量最大、读多写少、可跨请求共享;第二类是KV缓存,随上下文增长、通常绑定请求,但前缀部分可跨请求或跨轮次复用;第三类是中间激活,生命周期短但峰值带宽高;第四类是MoE专家参数,逻辑上属于权重,却具有按Token路由和热度偏斜特征;第五类是前缀、检索证据与工具定义,其语义复用周期可能长于单次会话;第六类是草稿模型状态、验证状态和工具结果,这些对象的价值取决于后续控制流。
如果仅按照“张量大小”进行淘汰,系统可能丢弃重算代价高、未来复用概率大的状态,同时保留大而低价值的对象。为描述第 个状态块的驻留价值,可定义:
其中, 表示未来复用概率, 表示重新计算代价, 表示对服务目标或任务正确性的贡献, 表示迁移成本, 表示占用快速存储的机会成本。式(2)不是固定算法,而是把传统LRU/LFU难以表达的语义价值、重算成本和精度风险纳入同一决策空间。对于系统提示词和工具描述, 较高;对于失败分支的临时推理, 可能较低;对于代码生成中的早期依赖和精确格式约束, 较高,不能仅凭低注意力分数直接删除。
2.3 推理模型与智能体对内存系统的新压力
推理模型通过延长输出获得更充分的搜索与验证,但每增加一个Token都会在多个层写入KV,并在后续步骤反复读取。DeepSeek-R1等工作显示,强化学习能够诱导长链推理行为[3];从系统角度看,这意味着输出长度由静态配置转为任务相关随机变量。传统容量规划常以固定最大输出长度乘以并发数,结果要么过度保守、降低利用率,要么在难题集中到来时触发抢占和换出。
智能体进一步引入控制流不确定性。工具调用会暂停GPU计算,却提供可用于状态预取的时间窗口;失败重试可能复用大部分历史上下文,也可能产生新的分支;多智能体协作会共享文档、计划和工具状态。因而,状态管理应从“请求开始时分配、请求结束时释放”的线性生命周期,转向可分支、可合并、可冻结、可恢复的图结构生命周期。后续架构是否先进,不应只看单轮聊天吞吐,而要看其能否识别这些状态差异并利用控制流信息。
3 内存中心化的统一分析框架
3.1 五维分析框架
文章提出“工作负载—状态对象—存储层级—数据运动—服务目标”五维框架,如图3所示。工作负载决定输入/输出长度、并发和复用模式;状态对象决定数据可否共享、可否丢失和重算代价;存储层级提供不同容量、带宽、时延、能耗和一致性语义;数据运动描述装载、预取、迁移、压缩、复制、近存计算等操作;服务目标则约束架构不能以牺牲正确率或尾延迟为代价追求平均吞吐。

图3 内存中心化的五维分析框架与多级状态空间
该框架可用于解释看似矛盾的结论。例如,把KV从HBM移至DDR会释放容量,但如果每个解码步都需要跨PCIe读取全量KV,TPOT会急剧增加;把注意力下沉到PIM可减少KV搬运,但如果投影和前馈网络仍需在GPU执行,算子切换与数据布局转换可能吞噬收益;把权重量化到4 bit可降低传输量,但如果硬件缺少原生格式支持,反量化、缩放和异常值路径可能成为新瓶颈。只有把五个维度同时写清,技术比较才具有可迁移性。
3.2 权重与KV容量模型
含 个参数、权重位宽为 的模型,其理想权重存储量为:
实际部署还需加入量化尺度、零点、稀疏索引、并行分片、执行工作区和冗余副本。对采用标准KV缓存的模型,设层数为 ,批量为 ,当前序列长度为 ,KV头数为 ,每头维度为 ,KV元素位宽为 ,则缓存容量为:
系数2分别对应Key和Value。式(4)揭示:KV容量随批量、层数、序列长度和KV头数线性增长。MQA把 降至1[18],GQA让多个查询头共享一组KV头[19],能够直接降低每Token缓存;多头潜变量注意力则把可缓存状态压缩为低维潜变量与位置编码分量[20],改变了传统按KV头计算容量的方法。
表2给出三个不对应特定商业产品的模型化算例。算例A为32层、32个KV头、头维128的MHA;算例B为80层、8个KV头、头维128的GQA;算例C为60层、每层缓存576维潜变量的压缩结构。所有数值仅由式(4)及对应潜变量容量公式推导,用于展示架构和精度对容量的数量级影响,不代表任何设备实测结果。
表2 不同注意力结构下单请求KV容量的模型化推演
| 架构算例 | 参数设定 | 每Token缓存 / KiB | 32K上下文FP16 / GiB | 128K上下文FP16 / GiB | 128K上下文4 bit / GiB |
|---|---|---|---|---|---|
| A:MHA | L=32,HKV=32,dh=128 | 512.00 | 16.00 | 64.00 | 16.00 |
| B:GQA | L=80,HKV=8,dh=128 | 320.00 | 10.00 | 40.00 | 10.00 |
| C:潜变量缓存 | L=60,d_c=576 | 67.50 | 2.11 | 8.44 | 2.11 |

图4 不同注意力结构与精度下的KV容量模型化推演
图4表明,位宽降低与结构压缩具有乘法关系,但两者改变的对象不同:结构优化减少必须保留的逻辑状态维度,量化减少每个状态元素的物理字节。系统设计不应把二者混为“压缩率”,因为结构改变往往需要模型训练或架构适配,而量化可在训练后实施,却可能引入格式转换和精度风险。
3.3 Token Roofline模型
经典Roofline模型用算术强度连接峰值算力和内存带宽。大模型推理需要进一步区分权重路径、KV路径和网络路径。设生成一个Token需要 次有效运算,权重传输量为 ,KV访问量为 ,跨设备或跨节点传输量为 ,相应有效吞吐为 、、 和 ,则单Token时延下界可近似表示为:
式中, 与 分别为调度和同步开销。采用最大值而非简单求和,是因为理想流水线能够重叠计算和传输;实际系统则应根据重叠比例增加残差项。图5示意不同数据通路的性能斜率。点A代表长上下文解码注意力,算术强度低;点B代表量化后或近存执行的解码;点C代表大批量预填充GEMM。量化可使点沿横轴右移,增加带宽可抬升斜率,算子融合可降低额外读写,而增加矩阵单元只会抬高水平计算上限。若工作点仍处在带宽斜率上,增加峰值FLOPS几乎无效。

图5 Token Roofline示意
对解码注意力进行理想化估算,忽略查询和输出的低阶流量,MHA/GQA每读取一个KV元素大致参与一次乘加。若查询头数为 ,KV头数为 ,则注意力算术强度近似为:
式(6)说明GQA和KV低比特表示不仅降低容量,也能提高单位读取字节承担的计算量。然而,这一估算未计入索引、尺度、掩码、Softmax及非合并访问。对于稀疏KV,若索引和随机访存开销过高,理论稀疏率不会等比例转化为速度。因此,论文报告压缩率时应同时报告实际读取字节、有效带宽利用率和核函数占用率。
3.4 能耗与成本模型
数据移动的能耗与层级密切相关。为避免把不同论文中的工艺、设备和测量口径硬性拼接,文章采用符号化模型。设状态块 放置于层级 ,其访问次数为 ,字节数为 ,单位字节访问能耗为 ,迁移能耗为 ,计算能耗为 ,则请求能耗为:
其中, 表示状态放置决策。成本还应计入设备折旧、闲置率、内存容量占用和网络资源。单位Token成本可表示为 。这意味着“单请求最省电”和“集群总体最省钱”可能不是同一方案:将冷KV移到较慢层级会增加单次恢复能耗,却可能显著提高昂贵GPU的并发和利用率;反之,过度预取会降低时延但浪费带宽和能源。
4 减少必须移动的数据量
4.1 MQA、GQA与潜变量缓存
减少KV状态维度是最直接的结构性路径。MQA让所有查询头共享一组Key和Value,在解码时显著减少缓存和内存带宽[18],但可能影响表达能力;GQA在多个查询头和较少KV头之间折中,可由多头注意力检查点转换并恢复大部分质量[19]。多头潜变量注意力通过低秩压缩降低可缓存维度,并把与旋转位置编码相关的分量单独处理[20]。三类方法的共同点是:在模型设计阶段改变“必须保留什么”,其收益可贯穿运行时和硬件;代价是需要训练适配,并可能增加投影、解压或算子定制。
结构压缩应与部署拓扑联合决定。若模型采用张量并行,KV头的数量还影响跨卡分片和复制;当 小于设备数时,简单均匀分片可能导致部分设备无独立KV头,需要复制或改变并行方式。潜变量缓存虽然降低容量,但如果通用推理框架仍按MHA张量布局分配内存,理论优势会被软件抽象泄漏。因此,运行时必须感知注意力变体,而不能把所有模型映射为统一MHA模板。
4.2 权重、激活与KV的低比特表示
SmoothQuant通过把激活异常值平滑迁移到权重,使权重和激活可采用INT8执行[21];AWQ根据激活分布保护重要权重通道,以低成本实现仅权重量化[22];GPTQ利用近似二阶信息逐块最小化量化误差[23];QuaRot使用旋转变换消除异常值,为4 bit端到端路径创造更规则的分布[24]。这些工作说明,低比特推理不只是“减少位数”,而是分布整形、尺度设计、误差补偿和硬件内核的联合问题。
进入FP4和微缩放阶段后,格式差异进一步放大。MXFP4通常采用块共享的幂次尺度,NVFP4采用更细粒度缩放与不同编码约束;MR-GPTQ指出,传统异常值抑制在小分组NVFP4中可能失效,而MXFP4的幂次尺度会引入新的误差来源,因此提出格式感知旋转和专用内核[25]。AdaMX进一步用少量元数据表达块间和操作数间异质性,并配套加速器解码逻辑[26]。SageAttention3把FP4用于注意力矩阵乘法,同时在更高精度中维持在线Softmax状态[27]。这些进展意味着未来编译器不能只接受抽象的“4 bit”属性,而应显式描述元素格式、块大小、尺度格式、累加精度、异常值通路和目标指令。
KV量化与权重量化存在本质差异。权重在部署前已知,可以离线校准;KV由请求在线生成,分布随层、头、Token和任务变化,且量化开销发生在延迟敏感路径。KIVI采用非对称2 bit KV量化并针对Key与Value的分布差异选择不同粒度[28];KVQuant研究了每通道、非均匀码本和异常值处理[29]。低比特KV可近似按位宽比例降低容量,但端到端收益取决于量化写入、反量化读取、尺度存储以及注意力内核是否原生消费量化数据。
4.3 稀疏保留、驱逐与可逆压缩
KV稀疏方法试图只保留对未来注意力重要的Token。H2O利用“重击者”Token长期获得较高注意力的现象,在固定预算内保留高价值状态[30];StreamingLLM保留初始“注意力汇”并使用滑动窗口,使模型能够处理超出训练窗口的流式输入[31];SnapKV根据观察窗口中的注意力模式选择关键位置,在提示压缩场景降低显存[32];PyramidKV按层分配不同缓存预算,利用深浅层信息密度差异[33]。这类方法能够降低物理状态量,但通常属于有损保留:局部基准上的平均准确率接近,不代表长输出、代码生成和工具调用中的轨迹一致。
VeriCache提出“压缩缓存起草、全量缓存验证”的思路,在保持与全量KV相同输出的同时利用压缩路径加速[34]。这一方向揭示了可逆性的重要性:系统可以把高精度全量状态放在较慢层级,把压缩状态保留在HBM进行大部分解码,再以较低频率恢复和验证。它把KV压缩与推测解码、分层存储结合,为“性能—正确性”提供比永久删除更可控的折中。对期刊研究而言,应把Token级语义准确率、输出完全一致率、工具调用成功率和结构化格式正确率分开报告,避免仅用困惑度掩盖功能性错误。
4.4 压缩收益的边界条件
压缩方案至少受四类边界约束。第一,压缩率不等于带宽下降比例,元数据和非合并访问可能抵消收益;第二,若瓶颈是权重读取而非KV读取,KV压缩只会提高并发,不一定降低单Token时延;第三,量化与稀疏会改变核函数形状,过小或不规则工作块可能降低矩阵单元利用率;第四,有损误差会随输出长度和控制流累积。因而,完整实验应包含无压缩、仅容量受限、仅带宽受限和混合受限四组场景,并通过消融实验分离“更多请求可驻留”与“单请求更快”的贡献。
5 提升局部性与运行时利用率
5.1 I/O感知注意力的持续演进
FlashAttention系列的核心不是某一代GPU上的速度数字,而是把访存复杂度纳入算法设计。第一代通过分块和重算减少HBM读写[5];第二代通过工作划分减少线程间通信和非矩阵运算[6];第三代利用异步复制和Warp专门化重叠张量核与Softmax[7];第四代针对计算单元增长快于共享内存、指数运算和通用ALU的非对称扩展,重新安排流水线并用软件近似缓解非矩阵单元瓶颈[8]。这一脉络对NPU和自研芯片同样适用:硬件演进会移动瓶颈,编译器必须重新决定分块、预取、累加和同步,而不能把旧内核直接移植到新指令集。
从内存中心化视角看,注意力内核应公开至少五类契约:①可接受的KV物理布局;②支持的量化格式和尺度粒度;③分页、稀疏和变长序列的元数据接口;④片上存储需求及双缓冲方式;⑤与外部DMA或PIM设备重叠的同步点。没有这些契约,系统层只能通过复制和格式转换连接组件,导致各层局部最优、端到端次优。
5.2 分页、虚拟内存与物理连续性
PagedAttention把KV划分为固定大小块,逻辑块表指向物理页,能够减少为最大长度预留的内部碎片[10]。块式设计还支持写时复制和共享前缀,但注意力内核需要读取页表并适配非连续布局。vAttention选择另一条路径:保留连续虚拟地址和标准注意力内核,通过GPU虚拟内存按需分配物理页[11]。二者没有绝对优劣,关键在于页大小、映射更新成本、TLB覆盖、内核兼容性和共享粒度。
页越小,碎片和复制放大越低,但页表、TLB和调度元数据开销越高;页越大,顺序DMA和远端传输更高效,却可能迁移大量未使用Token。未来运行时可采用“逻辑小页、物理大块”的双粒度组织:逻辑层维持细粒度引用,传输层把相邻热页合并为大块,PIM层再按Bank和行缓冲布局重排。该设计需要地址翻译、引用计数和压缩格式共同参与,已超出传统显存分配器的职责。
5.3 前缀缓存与结构化复用
SGLang的RadixAttention把前缀Token序列映射为基数树节点,允许多请求共享最长公共前缀[12]。这种机制对固定系统提示词、少样本示例、RAG文档和树搜索尤其有效。Mooncake则把前缀KV扩展为分布式全局缓存[16]。然而,复用不是简单命中/未命中:不同模型版本、RoPE缩放、量化格式、张量并行度和KV布局可能使语义相同的前缀无法直接共享。
因此,KV对象需要类似“可执行状态类型”的描述符,包括模型标识、权重版本、Tokenizer版本、位置编码参数、层范围、头布局、精度、页大小和并行拓扑。跨节点缓存键只使用文本哈希是不充分的;即使Token相同,模型或位置参数不同也可能生成不可兼容的KV。系统还应区分内容寻址与位置相关寻址,为未来跨位置复用、片段拼接和CacheBlend类方法保留校正接口。
5.4 调度、批处理与流水线重叠
迭代级连续批处理通过在每个解码步吸收新请求和移除完成请求提高利用率[9]。分块预填充则把长预填充拆成多个片段,与解码穿插,以避免单个长请求阻塞整个批次[13]。阶段分离后,调度器还要决定预填充实例、解码实例、KV传输路径和开始时间。端到端最优要求把请求调度、显存分配、网络拥塞和缓存命中放在一个控制回路中。
表3从内存行为角度比较主要技术。可以看到,每类技术优化不同项,组合时还可能产生冲突。例如,极小分页有利于细粒度驱逐,却不利于SSD大块I/O;分块预填充降低TPOT干扰,却会增加中间KV分段和调度次数;阶段分离消除计算干扰,却新增KV网络传输。系统论文必须报告组合后的净收益,而不能把独立论文中的加速比相乘。
表3 大模型推理系统技术的内存行为比较
| 技术 | 主要优化对象 | 关键收益 | 新增代价 | 适用负载 |
|---|---|---|---|---|
| FlashAttention | 注意力中间张量 | 减少HBM读写 | 分块与硬件相关 | 长序列预填充、训练 |
| PagedAttention | KV物理分配 | 降低碎片、支持共享 | 页表与定制内核 | 高并发解码 |
| vAttention | KV虚拟地址 | 保持内核连续布局 | 虚拟内存管理成本 | 追求内核兼容的服务 |
| RadixAttention | 前缀KV复用 | 减少重复预填充 | 树维护与兼容性检查 | RAG、树搜索、智能体 |
| 分块预填充 | 请求时间片 | 降低预填充对解码干扰 | 调度次数增加 | 长短请求混合 |
| PD分离 | 阶段资源 | 分别优化TTFT与TPOT | KV传输与集群调度 | 大规模在线服务 |
| KV量化/稀疏 | KV表示 | 降低容量和带宽 | 精度、元数据、内核复杂度 | 长上下文与高并发 |
6 计算—状态解耦与CXL分层内存
6.1 预填充—解码分离的系统逻辑
DistServe指出预填充与解码具有不同并行偏好和时延目标,混部会产生相互干扰[14]。Splitwise从设备组合与总成本出发,把预填充放在计算能力强的资源上,把解码放在更适合带宽和低时延的资源上[15]。这种阶段解耦的真正价值不只是把一张GPU换成两类GPU,而是允许每个阶段独立扩容、独立批处理和独立选择并行度。
阶段分离也暴露了新的瓶颈:预填充产生的KV必须交给解码节点。如果直接传输全量KV,长上下文会消耗大量网络带宽并增加TTFT;如果在共享存储中落盘再加载,则增加I/O和目录查找。理想系统应在预填充开始前就选定解码节点或共享KV位置,并在层级或分块粒度上流式传递,使KV生成与网络传输重叠。对于超长输入,可把部分早期层或冷片段留在共享内存,仅把即将访问的热块预取到HBM。
6.2 全局KV缓存与状态目录
Mooncake利用GPU集群中未充分使用的CPU、DRAM、SSD和NIC建立分离式KV缓存,并通过调度器在SLO约束下选择复用和传输路径[16]。CacheGen把KV序列编码为更适于网络传输的压缩表示,降低远端缓存加载成本[35];InfiniGen利用当前层和前一层信息预测关键KV,从主机内存选择性加载[36];FlexGen通过GPU、CPU和磁盘之间的张量放置与流水线执行拓展可运行模型规模[37]。这些工作表明,多级状态空间已经从“显存不够时换出”的应急机制,转向主动利用容量、带宽和复用差异的架构组成。
全局KV目录至少需要维护:对象键、模型兼容信息、逻辑位置、物理副本、引用计数、热度、压缩格式、校验信息、所有权和失效版本。对于共享前缀,目录还要支持并发引用与写时复制;对于有损压缩,目录应保存恢复路径和质量等级;对于跨轮次智能体,目录应记录会话DAG和未来可能访问的分支。图6给出计算池与状态池解耦的逻辑数据面。

图6 预填充—解码分离与全局KV缓存的数据面
6.3 CXL内存池的角色
CXL在PCIe物理层之上提供缓存一致性和内存语义,CXL 3.1增强了Fabric管理、内存共享与池化能力[38];CXL 4.0把链路速率提升至128 GT/s,并扩展端口聚合、内存维护和RAS能力[39]。对大模型推理而言,CXL Type-3内存可作为主机可寻址的扩展容量,交换机和Fabric管理器可把内存从单机附件提升为可组合资源池。相比经文件接口访问SSD,CXL内存具有更细粒度寻址和更低软件栈开销;相比HBM,其带宽和时延仍存在数量级差异,不能把它当作透明等价的“更多显存”。
CXL适合存放温KV、共享前缀、低频专家和恢复用全量状态,但是否获益取决于访问模式。顺序、大块、可预取的数据更容易隐藏链路时延;解码每步随机拉取细粒度KV会把系统拖入远端内存延迟。可行策略包括:①HBM保存活跃窗口和高价值块,CXL保存其余上下文;②在工具调用、排队或前一层计算期间预取下一阶段状态;③把注意力或选择算子下沉到CXL设备附近,只返回聚合结果;④通过压缩降低链路字节,并在设备端解压。换言之,CXL的价值来自“容量池化+可编程数据路径”,而非简单内存扩容。
6.4 网络、拥塞与一致性
KV传输常与GPU计算、权重通信和存储I/O共享网络。若调度器只按GPU空闲度分配请求,多个长上下文预填充可能同时向同一解码池发送KV,形成突发拥塞。系统应为每个请求同时预留计算信用、HBM容量信用、网络信用和远端内存信用,并把P95/P99传输时间纳入放置决策。多副本KV还存在一致性和失效问题:模型热更新、量化参数变化、Tokenizer升级或位置编码配置变化都应触发精确失效,不能仅依赖TTL。
跨租户共享还涉及安全边界。KV张量包含输入内容的模型内部表示,未经授权的复用、残留页和侧信道可能泄露敏感信息。内存池需要地址隔离、传输加密、租户级密钥、可验证删除和审计。压缩或PIM设备端处理也应纳入可信计算边界。性能论文若忽略隔离开销,得到的共享命中率和带宽利用率可能无法直接用于生产环境。
7 近存计算、HBM-PIM与Chiplet
7.1 为什么把计算移向数据
当式(5)由 主导时,把KV从内存搬到GPU计算并非唯一方案,也可以把点积、Softmax前的归约或值向量聚合移到数据附近。NeuPIMs把GEMM导向NPU、把GEMV类解码任务导向PIM,并在两类设备间调度批量[40];PIM Is All You Need探索通过CXL连接PIM设备构建无GPU推理系统[41];LLMCompass等评价框架则用于在实现RTL前分析计算、带宽、面积和成本权衡[42]。这些研究表明,PIM最适合规则、数据复用低、带宽主导且控制流简单的算子,而不适合把完整动态推理栈无差别地下沉。
PIM设计面临三类失配。第一,预填充GEMM与解码GEMV需求不同,固定功能单元难以覆盖全阶段;第二,长上下文的KV容量可能超过单个PIM模块,需要跨模块分片和归约;第三,稀疏注意力和KV压缩带来动态索引、可变精度与不规则访问。硬件应提供轻量可编程性、DMA、地址翻译和分层归约,而运行时应决定哪些状态值得迁入计算层。
7.2 从单层PIM到跨层级处理
PAM提出在HBM-PIM、DRAM-PIM和SSD-PIM之间协调KV放置与注意力计算,利用上下文局部性把热Token留在高带宽层级,把冷Token放入大容量层级[43]。TokenStack则在同一HBM堆栈内区分容量层和PIM计算层,并利用逻辑基底Die执行跨层DMA、地址翻译、聚合与迁移时量化[44]。这类工作比“所有HBM层都加入PIM”更符合状态异质性,因为权重、激活、热KV和冷KV并不需要相同物理组织。
内存中心化架构的关键是把“计算在哪里”与“数据在哪里”联合优化。设状态块 可放置在层级集合 ,执行算子 可选择GPU、NPU或PIM位置 ,可构造多目标优化:
约束包括各层级容量、链路带宽、PIM计算槽位、SLO和允许误差。实际系统难以在线求解大规模整数规划,可采用两阶段策略:离线依据模型结构和硬件参数生成候选映射,在线依据热度、队列与上下文长度在候选中切换。状态迁移应设置滞回阈值,避免短期热度波动导致来回搬运。
7.3 Chiplet与开放互连
先进封装允许把计算、I/O、缓存、HBM控制和专用PIM逻辑拆分为不同Chiplet。UCIe 3.0支持48 GT/s和64 GT/s数据率,并增强运行时校准、管理和更大规模多Chiplet连接能力[45]。对大模型推理,Chiplet的价值不只在良率和复用IP,还在于按工作负载比例配置资源:预填充计算Chiplet可配置更多矩阵单元,解码/注意力Chiplet配置更多片上缓存和归约单元,I/O Chiplet负责CXL、RDMA和地址目录,HBM逻辑Die承担近存数据变换。
然而,Chiplet会把片上互连问题提升为封装内网络问题。MoE专家路由、张量并行All-Reduce和KV分片可能争用Die-to-Die链路;不同Chiplet时钟、功耗和热分布也会影响持续性能。设计时应报告每Token的封装内字节、链路利用率、跨Die跳数和拥塞尾延迟,而不能只报告单个计算Die峰值。图7给出一种角色分化的概念架构,强调它是分析框架而非已流片产品。

图7 GPU—PIM—Chiplet软硬件协同概念架构
7.4 软硬件契约与编译支持
异构架构需要中间表示明确表达状态与数据移动。传统计算图只描述算子依赖,缺少“该KV块可共享”“该状态可用4 bit存储但必须以FP16累加”“该对象可迁移但不可丢弃”等语义。建议在编译IR和运行时对象描述中增加:生命周期、可复用域、容许误差、恢复路径、访问预测、物理布局、并行拓扑和安全域。编译器据此生成多版本内核和迁移计划,运行时依据实时队列选择版本。
表4总结GPU、CXL、PIM与Chiplet方案的适用边界。它们并非替代关系:GPU提供通用计算和成熟软件栈,CXL提供容量与组合性,PIM降低特定数据移动,Chiplet把不同资源集成到可扩展封装。真正先进的系统往往是分层组合,而不是选择单一“万能芯片”。
表4 内存中心化硬件技术的能力与边界
| 技术 | 主要优势 | 主要限制 | 适合状态/算子 | 需要的软件支持 |
|---|---|---|---|---|
| GPU/NPU+HBM | 通用性强、生态成熟、片上算力高 | HBM容量与成本受限 | 权重、热KV、GEMM | 高效内核、分页与批处理 |
| CXL内存池 | 容量可组合、支持共享与扩展 | 时延和带宽弱于HBM | 温KV、前缀、低频专家 | 预取、目录、NUMA感知 |
| HBM-PIM | 近数据高带宽、降低KV搬运 | 面积/容量折中、编程受限 | 解码注意力、归约 | 算子切分、迁移与布局 |
| DRAM/SSD-PIM | 容量大、成本低 | 单元性能和随机访问受限 | 冷KV筛选、压缩、检索 | 分层调度、粗粒度I/O |
| Chiplet/UCIe | 资源比例可定制、IP复用 | 封装互连和热设计复杂 | 计算、I/O、目录角色分化 | 拓扑感知编译与NoP调度 |
| 3D存储—逻辑堆叠 | 高带宽密度、短数据路径 | 散热、制造与良率挑战 | 在线量化、地址翻译、PIM | 热感知调度与可靠性管理 |
8 工程决策与评价方法
8.1 从症状到技术选择
工程实践中常见的错误是看到显存不足就量化、看到TPOT高就换GPU、看到长上下文就把KV换到CPU。更可靠的流程是先识别瓶颈对象。若HBM容量不足但带宽仍有余量,应优先采用GQA/潜变量缓存、KV量化、分页和分层放置;若单Token时延由权重读取主导,应优先增加批量、权重量化或提高有效带宽;若KV读取主导,应考虑低比特KV、稀疏保留、PIM或局部窗口;若TTFT由长提示预填充主导,应采用FlashAttention、分块预填充和前缀复用;若P99由长短请求干扰主导,应进行SLO分类、PD分离和网络信用控制。
表5给出工作负载—技术适配矩阵。“高”表示通常具有直接收益,“中”表示依赖实现和负载,“低”表示不是首选。矩阵不是固定结论,而是用于指导实验分组。研究者应根据实际Token长度分布、复用率和硬件数据重新标定。
表5 工作负载与技术路径适配矩阵
| 技术路径 | 短对话 | 长输入RAG | 长链推理 | 智能体 | MoE | 端侧 |
|---|---|---|---|---|---|---|
| 权重量化 | 高 | 高 | 高 | 高 | 高 | 高 |
| KV量化/稀疏 | 中 | 高 | 高 | 高 | 中 | 高 |
| 前缀/Radix缓存 | 中 | 高 | 中 | 高 | 中 | 中 |
| 分块预填充 | 低 | 高 | 中 | 高 | 中 | 低 |
| PD分离 | 中 | 高 | 高 | 高 | 高 | 低 |
| CXL分层内存 | 低 | 高 | 高 | 高 | 高 | 低 |
| HBM-PIM | 中 | 中 | 高 | 高 | 中 | 中 |
| Chiplet专用化 | 中 | 高 | 高 | 高 | 高 | 高 |
8.2 统一评价指标
不同论文常在模型、硬件、上下文、并发和SLO上差异巨大,直接比较加速比容易失真。评价应至少覆盖六类指标:时延、吞吐、内存、数据移动、能耗成本和质量。Goodput定义为在TTFT、TPOT和错误率约束下成功完成的请求率,比无约束吞吐更贴近服务价值。对长链推理和智能体,还应报告任务成功率、工具调用正确率、结构化输出有效率和全量KV输出一致率。
表6 内存中心化推理系统的建议评价指标
| 维度 | 核心指标 | 必须同步披露的条件 |
|---|---|---|
| 时延 | TTFT、TPOT、端到端P50/P95/P99 | 输入/输出长度分布、到达过程、批处理策略 |
| 吞吐 | Token/s、请求/s、SLO合规Goodput | 并发、SLO阈值、拒绝与超时规则 |
| 内存 | 峰值HBM、每Token KV字节、碎片率、命中率 | 模型结构、KV精度、页大小、副本数 |
| 数据移动 | HBM/PCIe/CXL/网络读取字节、有效带宽 | 是否重叠、压缩格式、拓扑与链路 |
| 能耗成本 | J/Token、J/请求、设备小时、成本/百万Token | 功耗测量边界、利用率、设备折旧口径 |
| 质量正确性 | 困惑度、任务得分、完全一致率、工具成功率 | 数据集、输出长度、随机种子、解码参数 |
| 芯片实现 | 面积、频率、功耗、热限制、NoP流量 | 工艺、存储宏、综合/后仿/实测来源 |
8.3 可复现实验的最低要求
综述和架构论文不应把不同来源的峰值数字拼成虚构“统一实验”。可复现实验至少要做到:①固定模型权重版本、Tokenizer、推理框架、驱动和内核版本;②公开请求Trace或其统计分布,包括提示长度、输出长度、到达时间与前缀相似度;③分别报告冷启动和稳态结果;④说明KV是否跨请求复用、是否包含传输和量化时间;⑤给出P50、P95和P99,而非只给平均值;⑥功耗应明确使用板卡、节点还是集群边界;⑦硬件模拟应给出校准对象、误差和面积/功耗模型来源。
对于模型化研究,可采用“分析—微基准—Trace回放—端到端”四级证据链。首先用式(3)—式(8)确定可能瓶颈;其次用GEMM、Attention、DMA、CXL和网络微基准测量有效参数;再次用真实或公开Trace回放容量和队列行为;最后在端到端任务中验证SLO与正确率。每一级都应保留误差范围,避免用理论带宽替代有效带宽、用单核函数速度替代请求速度。
8.4 架构决策流程
面向具体部署,可依次执行以下决策:①测量权重、KV、激活和网络字节占比,定位式(5)的主导项;②根据表1确定负载类别和不可牺牲指标;③用式(4)计算不同上下文、并发和精度下的容量边界;④选择减少字节、增加局部性、扩展层级或近存计算的候选组合;⑤建立端到端成本函数并加入SLO、质量和安全约束;⑥通过Trace回放验证尾延迟和拥塞;⑦仅在软件路径稳定后评估专用PIM或Chiplet。这样可以避免先画芯片框图、再寻找适用场景的倒置流程。
9 前沿问题与研究路线
9.1 从KV缓存管理走向状态执行管理
2026年的研究已经开始把KV缓存视为运行时控制问题,而非单纯存储问题[46]。未来系统需要理解状态与执行图的关系:一个KV块可能属于固定前缀、检索证据、失败分支或尚未完成的工具节点,其未来价值由任务图而非最近访问时间决定。运行时应为状态对象建立类型系统和生命周期协议,支持派生、冻结、分支、合并、验证与回收。这将使缓存、调度和智能体编排从三个模块收敛为统一状态机。
9.2 自适应且可逆的精度层级
固定INT4或FP4难以覆盖所有层、头和任务。未来量化应根据块分布、访问热度、输出长度和任务风险动态选择格式,并保留可恢复路径。格式感知FP4[25][26][27]与无损验证缓存[34]已经提供两类基础:前者使硬件能够按块表达异质性,后者使系统能用低精度路径起草、以高精度状态验证。进一步研究可把HBM中的热KV设置为4 bit、CXL中的全量KV设置为8/16 bit,在检测到低接受率或高风险工具调用时自动提升精度。
9.3 跨模型与跨位置状态复用
现有KV通常与模型权重和Token位置严格绑定。多模型路由、草稿—目标模型和模型热更新会产生大量相似但不兼容状态。研究方向包括:学习可迁移的低维前缀状态、对位置偏移进行校正、在模型族之间复用共享底层表示,以及通过轻量验证保证结果一致。该方向可能大幅降低多模型服务中的重复预填充,但也带来语义偏差、版本管理和安全验证问题。
9.4 高带宽闪存与多级PIM
高带宽闪存试图用接近HBM的并行接口获得远高于HBM的容量[4],多级PIM则在HBM、DRAM和SSD附近分别执行适合的筛选、归约和注意力子任务[43][44]。两条路线的共同挑战是数据布局和控制协议:闪存适合大块顺序访问,而Token级注意力具有细粒度动态索引;PIM设备之间需要在线迁移和归约,却缺少统一编程模型。未来可围绕“粗粒度预取+设备端选择+高层级验证”构建新数据路径,而不是要求闪存或PIM完全模拟HBM语义。
9.5 开放标准、可靠性与安全
CXL和UCIe为内存池和Chiplet生态提供开放互连基础[38][39][45],但大模型状态尚缺少跨设备通用格式。可标准化内容包括KV对象元数据、压缩格式协商、页迁移、设备端算子调用、校验与失效协议。可靠性方面,低电压、低比特和大规模3D堆叠会提高软错误和热失效风险;安全方面,跨租户状态共享要求加密、完整性、清零和访问证明。未来论文应把RAS与安全开销纳入每Token成本,而不是作为部署后的附加模块。
9.6 评价框架从峰值性能转向状态效率
LLMCompass等工具证明,可以在周期级模拟与粗粒度Roofline之间建立较快的设计空间评估[42]。下一步评价框架应加入动态请求Trace、多级KV目录、CXL/网络拥塞、PIM迁移和精度恢复,以每单位快速存储承载的SLO合规Token、每跨层级字节产生的有效Token和每焦耳正确完成的任务数作为核心指标。只有评价尺度发生变化,芯片设计才会从堆叠计算单元转向优化状态效率。
10 结 论
大模型推理正在从“计算中心化”转向“状态与数据运动中心化”。文章通过五维框架和Token Roofline模型表明,预填充、解码、长链推理和智能体负载具有不同算术强度、状态生命周期与服务目标,峰值FLOPS无法单独解释端到端性能。MQA、GQA和潜变量缓存减少逻辑状态维度,INT/FP低比特与稀疏保留减少物理字节,FlashAttention、分页和前缀缓存提高局部性,PD分离、全局KV与CXL扩展状态空间,PIM和Chiplet则重新配置计算与数据的物理距离。
主要结论如下:①KV缓存应被视为带有类型、版本、价值和恢复路径的可调度状态,而不是设备内匿名张量;②低比特和稀疏技术的评价必须同时包含内核兼容性、元数据、输出长度和功能正确性,压缩率不能替代端到端证据;③CXL、PIM和Chiplet的收益依赖软件对热度、生命周期、拓扑与拥塞的感知,透明扩容或单一专用加速器难以覆盖全部负载;④未来架构的核心能力是预测状态价值、把热状态放在合适层级、在计算与迁移之间建立重叠,并在性能、能耗、成本、可靠性和安全之间进行在线权衡。
由此,芯片、编译器和服务系统不应继续以彼此独立的接口演进。较为可行的路线是:模型在训练阶段暴露可压缩和可复用结构,编译器生成格式与层级感知的多版本内核,运行时维护状态目录和SLO控制,硬件提供可组合内存、近存计算、地址翻译与低开销Die-to-Die互连。内存中心化不是削弱计算的重要性,而是把计算置于完整数据路径中重新衡量,从而为下一代大模型推理基础设施建立更可信的设计尺度。
Memory-centric architecture evolution for large-model inference
Abstract Reasoning-oriented large models, long-context applications and autonomous agents are shifting the dominant bottleneck of inference from peak arithmetic throughput to the movement of model weights, key-value caches, expert parameters and intermediate states across memory and interconnect hierarchies. To unify optimizations that are usually studied separately at the operator, runtime, memory-system and accelerator levels, this article develops a five-dimensional framework covering workload, state object, storage tier, data movement and service objective, together with a capacity-bandwidth-latency-energy model for token generation. The analysis shows that: ① prefill and decode exhibit fundamentally different arithmetic intensity, state lifetime and latency objectives; ② low-bit microscaling, KV compression and sparse retention reduce transferred bytes, but their gains depend on format-conversion overhead, accuracy recovery and reversibility; ③ prefill-decode disaggregation, global KV caches, CXL memory pools and near-memory processing elevate KV caches from device-local tensors to independently schedulable system state; and ④ future inference architectures should perform value-aware placement, reversible compression, communication-computation overlap and heterogeneous Chiplet coordination instead of merely adding matrix units. Model-based capacity cases, a Token Roofline method and reproducible evaluation criteria are provided to support joint design of accelerators, compilers and serving systems.
参考文献
[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Long Beach: Curran Associates, 2017, 30: 5998-6008.
[2] POPE R, DOUGLAS S, CHOWDHERY A, et al. Efficiently scaling transformer inference[C]//Proceedings of Machine Learning and Systems. 2023, 5: 606-624.
[3] DEEPSEEK-AI. DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning[EB/OL]. 2025[2026-09-03]. arXiv:2501.12948.
[4] MA X, PATTERSON D. Challenges and research directions for large language model inference hardware[EB/OL]. 2026[2026-09-03]. arXiv:2601.05047.
[5] DAO T, FU D Y, ERMON S, et al. FlashAttention: Fast and memory-efficient exact attention with IO-awareness[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2022, 35: 16344-16359.
[6] DAO T. FlashAttention-2: Faster attention with better parallelism and work partitioning[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[7] SHAH J, BIKSHANDI G, ZHANG Y, et al. FlashAttention-3: Fast and accurate attention with asynchrony and low-precision[EB/OL]. 2024[2026-09-03]. arXiv:2407.08608.
[8] ZADOURI T, HOEHNERBACH M, SHAH J, et al. FlashAttention-4: Algorithm and kernel pipelining co-design for asymmetric hardware scaling[EB/OL]. 2026[2026-09-03]. arXiv:2603.05451.
[9] YU G I, JEONG J S, KIM G W, et al. Orca: A distributed serving system for Transformer-based generative models[C]//16th USENIX Symposium on Operating Systems Design and Implementation. Carlsbad: USENIX Association, 2022: 521-538.
[10] KWON W, LI Z, ZHU S, et al. Efficient memory management for large language model serving with PagedAttention[C]//Proceedings of the 29th ACM Symposium on Operating Systems Principles. Koblenz: ACM, 2023: 611-626.
[11] PRABHU R, NAYAK A, MOHAN J, et al. vAttention: Dynamic memory management for serving LLMs without PagedAttention[C]//Proceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems. Rotterdam: ACM, 2025: 1133-1150.
[12] ZHENG L, YIN L, XIE Z, et al. SGLang: Efficient execution of structured language model programs[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37: 62557-62583.
[13] AGRAWAL A, PANWAR A, MOHAN J, et al. Taming throughput-latency tradeoff in LLM inference with Sarathi-Serve[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 117-134.
[14] ZHONG Y, LIU S, CHEN J, et al. DistServe: Disaggregating prefill and decoding for goodput-optimized large language model serving[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 193-210.
[15] PATEL P, CHOU C, CHARDON P, et al. Splitwise: Efficient generative LLM inference using phase splitting[C]//Proceedings of the 51st Annual International Symposium on Computer Architecture. Buenos Aires: IEEE, 2024: 118-132.
[16] QIN R, LI Z, HE W, et al. Mooncake: Trading more storage for less computation—A KVCache-centric architecture for serving LLM chatbot[C]//23rd USENIX Conference on File and Storage Technologies. Santa Clara: USENIX Association, 2025: 155-170.
[17] ZHU K, ZHAO Q, ZHAO H, et al. NanoFlow: Towards optimal large language model serving throughput[C]//19th USENIX Symposium on Operating Systems Design and Implementation. Boston: USENIX Association, 2025.
[18] SHAZEER N. Fast Transformer decoding: One write-head is all you need[EB/OL]. 2019[2026-09-03]. arXiv:1911.02150.
[19] AINSLIE J, LEE-THORP J, DE JONG M, et al. GQA: Training generalized multi-query transformer models from multi-head checkpoints[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Singapore: Association for Computational Linguistics, 2023: 4895-4901.
[20] DEEPSEEK-AI. DeepSeek-V2: A strong, economical, and efficient mixture-of-experts language model[EB/OL]. 2024[2026-09-03]. arXiv:2405.04434.
[21] XIAO G, LIN J, SEZNEC M, et al. SmoothQuant: Accurate and efficient post-training quantization for large language models[C]//Proceedings of the 40th International Conference on Machine Learning. Honolulu: PMLR, 2023: 38087-38099.
[22] LIN J, TANG J, TANG H, et al. AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration[C]//Proceedings of Machine Learning and Systems. 2024, 6: 87-100.
[23] FRANTAR E, ASHKBOOS S, HOEFLER T, et al. GPTQ: Accurate post-training quantization for generative pre-trained transformers[C]//International Conference on Learning Representations. Kigali: OpenReview, 2023.
[24] ASHKBOOS S, MOHTASHAMI A, CROCI M L, et al. QuaRot: Outlier-free 4-bit inference in rotated LLMs[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
[25] EGIAZARIAN V, PANFEROV A, KUZNETSOV A, et al. Bridging the gap between promise and performance for microscaling FP4 quantization[EB/OL]. 2025[2026-09-03]. arXiv:2509.23202.
[26] LUO J, JIANG X, WEN T H, et al. Heterogeneity-aware microscaling for efficient low-bit LLM inference[EB/OL]. 2026[2026-09-03]. arXiv:2608.03867.
[27] LIN J, LUO M, ZHANG J, et al. SageAttention3: Fast attention on Blackwell GPUs via FP4 quantization[EB/OL]. 2025[2026-09-03]. arXiv:2505.11594.
[28] LIU Z, ZHAO C, FIELDER E, et al. KIVI: A tuning-free asymmetric 2bit quantization for KV cache[C]//Proceedings of the 41st International Conference on Machine Learning. Vienna: PMLR, 2024.
[29] HOOPER C, KIM S, MOHAN J, et al. KVQuant: Towards 10 million context length LLM inference with KV cache quantization[EB/OL]. 2024[2026-09-03]. arXiv:2401.18079.
[30] ZHANG Z, SHENG Y, ZHOU T, et al. H2O: Heavy-hitter oracle for efficient generative inference of large language models[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2023, 36: 34661-34710.
[31] XIAO G, TIAN Y, CHEN B, et al. Efficient streaming language models with attention sinks[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[32] LI Y, HUANG Y, YANG B, et al. SnapKV: LLM knows what you are looking for before generation[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37: 22947-22970.
[33] CAI Z, ZHANG Y, GAO B, et al. PyramidKV: Dynamic KV cache compression based on pyramidal information funneling[EB/OL]. 2024[2026-09-03]. arXiv:2406.02069.
[34] YAO J, SHEN S, DU K, et al. VeriCache: Turning lossy KV cache into lossless LLM inference[EB/OL]. 2026[2026-09-03]. arXiv:2605.17613.
[35] LIU Y, LI H, CHENG Y, et al. CacheGen: KV cache compression and streaming for fast large language model serving[C]//Proceedings of the ACM SIGCOMM 2024 Conference. Sydney: ACM, 2024: 38-56.
[36] LEE W, LEE J, SEO J, et al. InfiniGen: Efficient generative inference of large language models with dynamic KV cache management[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 155-172.
[37] SHENG Y, ZHENG L, YUAN B, et al. FlexGen: High-throughput generative inference of large language models with a single GPU[C]//Proceedings of the 40th International Conference on Machine Learning. Honolulu: PMLR, 2023: 31094-31116.
[38] CXL CONSORTIUM. Introducing Compute Express Link 3.1: Significant improvements in fabric connectivity, memory pooling and security[EB/OL]. 2023[2026-09-03].
[39] CXL CONSORTIUM. Compute Express Link 4.0 specification[EB/OL]. 2025[2026-09-03].
[40] HEO G, LEE S, CHO J, et al. NeuPIMs: NPU-PIM heterogeneous acceleration for batched LLM inferencing[C]//Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems. La Jolla: ACM, 2024.
[41] GU Y, KHADEM A, UMESH S, et al. PIM is all you need: A CXL-enabled GPU-free system for large language model inference[C]//Proceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems. Rotterdam: ACM, 2025: 862-881.
[42] ZHANG H, NING A, PRABHAKAR R B, et al. LLMCompass: Enabling efficient hardware design for large language model inference[C]//Proceedings of the 51st Annual International Symposium on Computer Architecture. Buenos Aires: IEEE, 2024: 1080-1096.
[43] LIU L, WANG Y, LI X, et al. PAM: Processing across memory hierarchy for efficient KV-centric LLM serving system[EB/OL]. 2026[2026-09-03]. arXiv:2602.11521.
[44] LI Z, BIAN Z, HUANG Z, et al. TokenStack: A heterogeneous HBM-PIM architecture and runtime for efficient LLM inference[EB/OL]. 2026[2026-09-03]. arXiv:2605.05639.
[45] UCIe CONSORTIUM. UCIe 3.0 specification: Driving innovation for efficient, scalable, and reliable Chiplet integration[EB/OL]. 2025[2026-09-03].
[46] YANG P, ZHANG R, LIU F. Towards efficient large language model serving: A survey on system-aware KV cache optimization[EB/OL]. 2026[2026-09-03]. arXiv:2607.08057.
