摘要
智能体推理把一次模型调用扩展为规划、工具执行、观察回填、验证与重试组成的长生命周期工作流,使KV缓存由请求内临时张量转变为跨轮次执行状态。针对最近最少使用、固定生存时间和单次注意力重要性难以表达任务依赖、重算代价与质量风险的问题,文章提出生命周期感知KV缓存系统AgentKV。该系统以事件图标注状态类型与版本,利用依赖路径、未来复用概率和重算代价估计状态价值,并在GPU HBM、主机DDR/CXL和NVMe之间联合选择驻留层级、压缩精度及恢复时机;同时利用工具调用间隙执行迁移、可逆压缩和预测预取。基于3 000批、每批32个状态块的事件级离散仿真,在HBM预算为工作集35%的配置下,AgentKV相较LRU将恢复附加时延P95由5.59 ms降至3.77 ms,跨层传输量由563.10 MB/批降至159.49 MB/批,分别降低32.51%和71.68%,并隐藏50.28%的恢复开销。研究表明,智能体缓存优化的关键不是追求单一命中率,而是联合管理状态生命周期、可逆性、尾延迟和正确性风险。
大语言模型正在从一次性问答组件转变为能够规划任务、调用搜索或代码执行工具、读取环境反馈并反复修正策略的智能体。ReAct把推理与行动组织为交替序列[2],Toolformer进一步展示了模型学习工具使用模式的可行性[3]。这一变化不仅扩大了上下文长度,也改变了推理系统的时间结构:模型计算被毫秒级解码、秒级工具调用、失败重试和多分支验证打断,已生成的KV缓存可能在数秒后被再次访问,也可能因任务节点提交而永久失去价值。PagedAttention通过分页降低设备内碎片[4],SGLang利用结构化程序和前缀复用减少重复预填充[5],但二者主要解决“缓存如何组织”,尚不能回答“一个智能体状态何时应被保留、压缩、迁移、验证或退休”。近期Tokencake、Continuum、MORI、PBKV和CommitKV分别从工具空闲期、TTL、相对空闲度、未来调用预测与提交转移切入[11][12][13][14][15][16],说明智能体缓存已经形成独立研究方向。文章在此基础上提出AgentKV:不读取模型隐式推理文本,而是依据工作流控制事件建立状态图,并把未来依赖、重算代价、精度风险和工具间隙统一纳入多级放置决策。文章的贡献包括:①给出面向智能体事件图的KV状态模型;②提出风险约束的可逆压缩与多级放置目标;③设计工具间隙迁移和预测预取机制;④以可复现离散仿真验证容量、尾延迟、传输量和预测误差之间的关系。
1 智能体KV状态与问题定义
1.1 从请求缓存到执行状态
标准自回归推理中,第l层对历史Token产生键和值,并在后续解码步中反复读取。设批量为B、层数为L、上下文长度为T、KV头数为Hₖᵥ、每头维度为dₕ、元素位宽为b,则未考虑分页和元数据时的缓存容量为:
式(1)说明KV容量与上下文长度和活动会话数近似线性增长。对于智能体,请求结束不再意味着状态失效,因为工具调用后的下一轮模型执行往往复用全部或大部分历史前缀。若系统立即释放缓存,需要重新预填充;若长期固定驻留,又会挤压其他活动会话。因此,“请求完成”与“状态生命周期结束”必须分离。

图1 智能体工作流与KV状态生命周期
图1把智能体执行抽象为事件序列。模型规划产生候选动作,工具调用使会话进入冻结状态,观察返回后追加新的Token并恢复解码;验证或提交事件则改变旧状态的未来依赖。与聊天机器人主要由用户思考时间决定下一轮到达不同,智能体工具时长呈现明显重尾分布,且同一程序可能在“连续短调用”和“长时间阻塞”之间切换。MORI把这种差异概括为相对空闲度[13],Continuum用TTL平衡复用和排队[12],Tokencake则在空间隔离与工具间隙上传之间协同[11]。AgentKV进一步把状态粒度从会话下沉到事件页,使同一会话中的系统前缀、证据、失败分支和已验证结果可以采取不同策略。
1.2 状态类别与生命周期语义
文章把一段可独立管理的KV页表示为sᵢ=〈vᵢ,τᵢ,gᵢ,qᵢ,zᵢ〉。其中vᵢ是KV数据与位置映射,τᵢ是语义类型,gᵢ是所属事件图节点和版本,qᵢ是当前数值精度及可恢复副本,zᵢ记录驻留层级、最近访问和迁移状态。语义类型由系统提示边界、工具调用协议、消息角色和工作流编排器产生,不要求读取或分类模型隐藏的思维链,因此不会把缓存管理建立在不可审计的文本内容推断上。
表1 智能体KV状态类别及默认管理策略
| 状态类别 | 典型来源 | 生命周期判据 | 默认策略 |
|---|---|---|---|
| 固定前缀 | 系统提示、工具Schema | 会话或租户级版本变化 | 跨轮次共享,高精度或稳定低比特 |
| 任务输入 | 用户目标、约束 | 任务结束或目标重写 | 活动阶段驻留,分支切换后降级 |
| 证据状态 | 检索文档、代码片段 | 依赖节点全部提交 | 高重算代价,优先保留可逆副本 |
| 工具观察 | 搜索、数据库、编译器返回 | 观察被替代或提交 | 短期高价值,利用工具间隙预取 |
| 已验证结果 | 测试通过、计算确认 | 下游节点完成 | 高正确性权重,避免不可逆删除 |
| 临时推理 | 候选计划、中间草稿 | 分支提交或超时 | 混合精度压缩,保留重算入口 |
| 失败分支 | 无效动作、错误路径 | 失败事件确认 | 低优先级退休,仅保留审计摘要 |
状态类别并非静态标签。工具观察在进入系统时属于高价值新状态,若后续被新结果覆盖,则可转为冷状态;临时推理在通过外部测试后可提交为已验证结果;固定前缀发生版本升级时,旧版本可能继续服务在途任务但不得被新任务复用。由此形成图2中的状态机:活跃、冻结、压缩、恢复和提交/退休是系统动作,事件图则提供动作合法性。

图2 AgentKV状态转换与控制条件
1.3 现有策略的适用边界
LRU只观察最近访问时间,无法区分即将返回的短工具调用和长期阻塞任务;LFU或ARC能够适应频率变化[30],但智能体状态通常只在少数关键节点被访问,低频并不等于低价值。TTL引入了下一轮时间窗口,却难以处理同一会话内部不同事件页的差异。注意力驱逐方法H2O、SnapKV和StreamingLLM分别利用重击Token、观察窗口和注意力汇聚特征降低设备内KV规模[21][22][23],其目标主要是单次序列的解码质量,而不是跨轮次状态复用。IntentKV引入跨轮次意图记忆[17],CommitKV依据提交前后的删除效应识别完成状态[16],VeriCache通过完整KV验证实现输出等价[18]。这些工作分别提供了重要部件,但仍缺少把事件依赖、层级放置、压缩可逆性、工具时间窗口和SLO统一优化的接口。
表2 代表性KV管理方法与AgentKV的设计维度
| 方法类别 | 主要信号 | 粒度 | 可逆性 | 工具间隙 | 任务依赖 |
|---|---|---|---|---|---|
| 分页/前缀缓存 | 地址映射、前缀相同 | 块/请求 | 不涉及 | 否 | 弱 |
| 注意力驱逐 | 注意力得分、重击Token | Token/层 | 通常不可逆 | 否 | 无 |
| TTL/空闲度 | 预计返回时间、程序活跃度 | 会话 | 可卸载恢复 | 是 | 弱 |
| 调用预测 | 未来代理或工具序列 | 工作流/条目 | 可恢复 | 部分 | 中 |
| 提交感知压缩 | 提交前后删除效应 | 事件页 | 通常删除 | 否 | 强 |
| AgentKV | 事件依赖、复用、重算、风险、空闲期 | 事件页 | 压缩副本+验证/重算 | 是 | 强 |
2 AgentKV系统设计
2.1 总体架构
AgentKV位于智能体编排器与推理引擎之间,不改变模型参数和注意力算子语义。编排器向AgentKV发送任务开始、模型调用、工具发起、观察返回、分支创建、验证通过、回滚和任务结束等结构化事件;推理引擎提供KV页句柄、物理块映射、压缩算子和异步DMA队列。系统由事件图与语义标注、生命周期预测、SLO/风险控制、分层放置与可逆压缩、工具间隙迁移与预取五个模块组成,如图3所示。

图3 AgentKV总体架构
事件图为有向无环图或带有限回边的状态图。节点表示模型调用、工具调用、观察或验证事件,边表示数据依赖和控制依赖。每个KV页维护producer集合和consumer候选集合;当所有可达consumer已完成,且该页在审计或回滚策略下不再需要时,系统才能将其标记为“可退休”。若工作流具有循环,系统以版本号展开有限窗口,并通过保守汇总节点避免无限图增长。
2.2 生命周期预测与状态价值
未来复用概率不是单一的时间预测。AgentKV构造特征向量φᵢ,包括状态类型、距上次事件的时间、所在任务深度、后继节点数、工具类别、历史工具时长分位数、分支置信度、前缀共享度、重算Token数和当前队列压力。预测器输出下一次访问时间分布Fᵢ(t)、复用概率pᵢʳᵉᵘˢᵉ和置信区间。为了避免复杂模型在调度关键路径造成额外开销,在线实现可采用校准后的梯度提升树或小型多层感知机;当置信度低于阈值时,控制器退化为保守策略。
状态价值需要同时反映“保留后可能节省什么”和“占用快速存储会牺牲什么”。文章定义:
式中,Cᵢʳᵉᶜᵒᵐᵖ为重新预填充或重新执行工具的代价;Dᵢ是事件图依赖强度,可由尚未完成的可达节点数和关键路径权重计算;Qᵢ表示状态对结构化输出、代码正确性或安全约束的影响;Cᵢᵐᵒᵛᵉ包括DMA、压缩与同步成本;Cᵢᵒᶜᶜᵘᵖʸ是占用HBM导致的排队机会成本。系数由SLO和任务类型配置,代码修复任务通常提高Qᵢ和Cᵢʳᵉᶜᵒᵐᵖ权重,开放式检索任务则允许更积极压缩临时证据。
2.3 多级放置与可逆压缩
AgentKV把每个状态页放置到GPU HBM、主机DDR/CXL内存池或NVMe,并允许选择高精度、INT8、INT4、低秩表示以及“仅保留重算入口”等形态。KIVI和KVQuant表明KV量化能够显著降低容量[19][20],CacheGen进一步把KV压缩与网络流式传输结合[24];但智能体场景的关键问题是长输出中误差可能累积并破坏代码、JSON或工具参数。为此,AgentKV区分工作副本和参考副本:低风险页可仅保留压缩副本,高风险页在低层存储保留完整副本;恢复后可按检查点触发验证,或在异常时回退重算。
其中kᵢ和qᵢ分别为层级与精度,Lᵢ是预计恢复时延,Eᵢ是传输和压缩能耗,Rᵢ是质量风险上界,Cₖ为各存储层容量。该问题包含离散选择和容量约束,精确求解不适合在线调度。AgentKV采用两阶段近似:先依据价值密度Vᵢ/mᵢ确定HBM候选,再在被迁出页中以拉格朗日代价选择压缩级别和目标层;每轮只重算受事件影响的局部候选,复杂度近似为O(n log n)。
2.4 工具间隙迁移与预测预取
工具调用为状态管理提供了天然重叠窗口。系统在工具发起事件到达后,不立即迁出整个会话,而是依据预计空闲时间和未来依赖排序候选页。设状态页迁出、压缩、回迁与解压总耗时为Tᵢᵐᵒᵛᵉ,工具间隙为Tᵢᵍᵃᵖ,则可隐藏比例为:
当Tᵢᵍᵃᵖ较短时,只迁出低价值且传输小的页;当工具执行进入长尾阶段,系统逐步移动更多页而不是进行一次不可逆决定。预测预取从预计返回时刻向前回推Tᵢᵐᵒᵛᵉ,并预留带宽信用;若工具提前返回,未完成的预取可以取消,推理引擎优先使用仍在HBM的最小可执行前缀。MORI以相对空闲度划分GPU和CPU队列[13],PBKV预测未来代理调用[14],AgentKV则把预测对象细化为事件页,同时由风险控制器限制“预测错误导致高价值页过早降级”。

图4 工具空闲时长与可隐藏迁移比例
2.5 一致性、版本与安全边界
跨轮次复用必须防止错误前缀污染。每个状态页的身份由模型版本、适配器版本、Tokenizer版本、RoPE配置、租户、会话、逻辑位置和事件版本共同确定;只有身份完全兼容时才能零拷贝复用。工具Schema和系统提示发生更新时,旧页进入只读代际,服务完在途任务后回收。对于多租户部署,CXL或远端缓存的页需要加密、访问控制和擦除确认,缓存目录不得泄露其他租户的提示长度、工具名称或访问时间。TokenDance展示了多智能体共享块和差分存储的潜力[15],但共享越强,一致性和侧信道风险越需要显式纳入系统设计。
3 事件级仿真方法
3.1 仿真目的与边界
为了在没有特定厂商GPU、CXL交换机和完整生产Trace的条件下验证算法趋势,文章构建事件级离散仿真。该仿真不是硬件实测,也不用于宣称某一具体模型在真实集群上的绝对吞吐;它回答三个可验证问题:①在相同状态工作集和HBM预算下,事件依赖是否能改善放置;②压缩和工具间隙重叠能否减少可见恢复时延及传输量;③预测误差增加时,策略是否出现非连续失稳。随机种子、状态分布、传输带宽和公式均固定,便于复现。
表3 事件级仿真的关键参数
| 参数 | 设置 | 说明 |
|---|---|---|
| 仿真批次 | 3 000批 | 每批独立生成一个并发状态工作集 |
| 每批状态块 | 32个 | 从7类事件状态按给定概率抽样 |
| 状态大小 | 8~220 MB | 对数正态分布并截断 |
| 工具空闲时间 | 重尾对数正态 | 证据和工具观察具有更长均值 |
| 主机恢复带宽 | 24 GB/s | 含1.2 ms固定开销和排队扰动 |
| AgentKV压缩比 | 3.2∶1 | 含压缩、解压和回迁开销 |
| HBM预算 | 工作集20%~70% | 主结果采用35% |
| 预测噪声 | 对数误差0.05~0.90 | 主结果标准差为0.35 |
状态类型比例为:系统前缀7%、工具定义10%、证据状态18%、工具观察20%、已验证结果12%、临时推理23%、失败分支10%。每类状态具有不同复用概率、重算系数和正确性权重。例如,固定前缀复用概率设为0.99,失败分支为0.12;已验证结果的重算和质量权重最高。该设置用于制造“时间局部性与语义价值不完全一致”的压力场景,而不是拟合某一家产品。
3.2 对比策略与评价指标
仿真比较四类策略。LRU按最近访问时间保留页面;TTL依据预计空闲时间和页面大小排序;语义优先策略依据状态类型、近似注意力重要性与正确性权重排序;AgentKV使用式(3)的价值模型、3.2倍压缩副本及工具间隙预取。前三种策略的迁出页以完整精度从主机恢复,AgentKV则在低层存储维护压缩副本,并将一部分恢复过程隐藏在工具调用期间。
指标包括字节命中率、恢复附加时延P50/P95/P99、每批跨层传输量、迁移隐藏比例和风险代理。风险代理由预测相对误差、状态正确性权重和降级幅度构成,仅表示“需要高精度回退或验证的概率压力”,不是模型任务准确率,也不能替代真实代码、检索或工具调用评测。
4 结果与分析
4.1 HBM容量敏感性

图5 不同HBM预算下的字节命中率
随着HBM预算由工作集20%增加到70%,四种策略的字节命中率均提高。语义优先策略在多数容量点取得略高命中率,因为它倾向于保留高复用类别;AgentKV在20%~40%预算时的命中率略低于语义优先,但可见恢复时延明显更低。这一结果说明命中率不是充分目标:若未命中的页面能够被压缩,并在工具等待期间提前恢复,其用户可见代价可能低于“命中了更多字节但没有预取”的策略。

图6 不同HBM预算下的恢复附加时延P95
图6显示,AgentKV在所有容量点保持更低的P95恢复附加时延。HBM预算为20%时,AgentKV为4.07 ms,LRU为5.80 ms;预算为70%时,两者分别为3.01 ms和4.75 ms。随着容量增加,LRU依靠更多命中取得改善,而AgentKV仍受益于工具间隙和压缩传输。P95下降速度没有与命中率同步,是因为剩余未命中的大块或高关键状态决定尾部时延。
4.2 主配置对比
表4 HBM预算35%时的仿真结果
| 策略 | P50/ms | P95/ms | P99/ms | 字节命中率/% | 传输量/(MB/批) | 隐藏比例/% |
|---|---|---|---|---|---|---|
| LRU | 2.66 | 5.59 | 7.45 | 34.70 | 563.10 | 0.00 |
| TTL | 2.61 | 5.75 | 7.78 | 33.71 | 571.69 | 0.00 |
| 语义优先 | 0.00 | 5.83 | 7.84 | 42.99 | 491.68 | 0.00 |
| AgentKV | 0.00 | 3.77 | 4.68 | 40.82 | 159.49 | 50.28 |
在主配置下,AgentKV将P95由LRU的5.59 ms降至3.77 ms,下降32.51%;P99下降37.16%。传输量从563.10 MB/批降至159.49 MB/批,下降71.68%。AgentKV的字节命中率为40.82%,低于语义优先的42.99%,但后者P95为5.83 ms。这再次验证:多级缓存应优化“恢复代价×可见比例”,而不只是物理命中。
AgentKV的P50为0,表示超过一半的复用状态仍驻留HBM,或其恢复被工具间隙完全隐藏。隐藏比例50.28%是对所有迁出且后续复用页面的平均值。它并不意味着所有工具调用都能隐藏一半传输;短工具调用、预测过晚或带宽竞争仍会形成尾部。真实系统还需把PCIe/CXL链路与模型解码、网络收发的竞争纳入调度。
4.3 预测误差与风险控制

图7 预测误差对AgentKV尾延迟的影响
预测对数误差标准差由0.05增至0.90时,AgentKV的P95保持在3.70~3.79 ms,未出现陡升。这种稳定性来自两点:第一,价值排序同时依赖任务图、重算代价和页面大小,工具时长只是一个信号;第二,低置信度页不会直接不可逆删除,而是保留压缩副本或重算入口。风险代理从1.05%上升到12.16%,表明预测越不可靠,系统越频繁触发保守放置、完整副本或验证。该代理的作用是把潜在质量成本暴露给调度器,而不是用“时延稳定”掩盖模型正确性风险。
4.4 消融分析
基于主配置进行机制级消融,并以完整AgentKV为归一化参照。去掉工具间隙预取时,传输字节不变但P95恢复附加时延接近压缩恢复的完整成本;去掉可逆压缩时,传输量回升到主机完整KV水平;去掉事件依赖后,系统容易保留近期但已提交的状态;去掉风险控制则可能获得更低平均时延,却无法给代码和工具参数提供错误边界。表5给出根据同一成本模型得到的方向性结果,数值只用于说明组件贡献。
表5 AgentKV机制消融的归一化结果
| 配置 | P95时延 | 传输量 | 高价值误淘汰代理 | 说明 |
|---|---|---|---|---|
| 完整AgentKV | 1.00 | 1.00 | 1.00 | 事件图、压缩、预取和风险控制全部开启 |
| 无工具间隙预取 | 1.41 | 1.00 | 1.00 | 无法隐藏恢复,尾延迟增加 |
| 无可逆压缩 | 1.27 | 3.20 | 0.92 | 完整KV传输,质量更保守但带宽压力大 |
| 无事件依赖 | 1.18 | 1.09 | 1.64 | 按复用与时间排序,提交语义丢失 |
| 无风险控制 | 0.94 | 0.91 | 2.73 | 更激进降级,不适合正确性敏感任务 |
| 固定精度 | 1.12 | 1.36 | 1.08 | 不能按状态关键性选择表示 |
5 原型实现路径与工程讨论
5.1 与推理引擎的接口
AgentKV不要求重写完整推理引擎。最小实现可以建立在PagedAttention物理块之上:编排器为每条消息和工具事件附加事件ID;引擎在KV页表中记录事件ID、逻辑位置和压缩描述符;后台线程执行异步迁移;恢复时重新建立逻辑页到物理页的映射。对于SGLang式前缀树,事件图节点可引用Radix树区间,避免重复记录共享前缀。LMCache和Mooncake已经展示了外部KV层与分离式存储路径[8][10],AgentKV的增量主要是事件语义、风险描述符和调度目标。
在线关键路径需要保持轻量。状态价值不必逐Token更新,可在工具发起、观察返回、分支提交和内存压力变化时重算;页面压缩可使用GPU空闲流或主机向量指令;CXL内存池适合保存跨GPU可访问的温状态,但应防止多个解码节点同时回迁造成带宽惊群。系统可对每个会话发放HBM、主机内存和链路信用,超出信用的工作流进入延迟队列或降低压缩精度。
5.2 正确性与可观测性
智能体常输出代码、SQL、函数参数和结构化JSON,细小数值误差可能在长解码中演化为控制流错误。VeriCache指出有损KV输出偏离会随生成长度累积,并用完整缓存验证草稿Token[18]。AgentKV可把该思想用在“高风险事件页”:压缩KV用于快速草拟,低层完整副本在检查点验证;若没有完整副本,则由重算入口恢复对应前缀。监控层应记录压缩级别、恢复来源、验证拒绝率、重算Token数、任务成功率和结构化输出错误,而不能只上报显存节省。
为避免系统读取隐式思维链,语义标签只来自可观测协议边界:消息角色、工具名称哈希、工具调用ID、返回状态码、测试通过/失败和任务图边。对证据重要性的估计可使用依赖计数与引用关系,而不是保存或分类敏感原文。对于需要长期审计的任务,退休状态可留下不可逆摘要和内容哈希,但KV张量本身按数据保留策略删除。
5.3 适用范围与局限性
表6 AgentKV的适用场景与限制
| 方面 | 适用条件 | 主要限制 | 改进方向 |
|---|---|---|---|
| 工作流 | 存在明确工具/事件边界 | 自由对话缺少任务图 | 从请求日志学习弱依赖图 |
| 存储 | 具有主机内存、CXL或NVMe层 | 链路竞争可能抵消收益 | 带宽信用与拥塞反馈 |
| 压缩 | 模型支持KV量化或低秩表示 | 长输出正确性难以静态保证 | 完整副本验证与在线回退 |
| 预测 | 工具时长和调用结构有局部稳定性 | 突发故障与新工具分布漂移 | 置信度校准和保守降级 |
| 共享 | 模型、位置编码和前缀身份一致 | 跨租户泄露与版本污染 | 加密、隔离、代际目录 |
| 评价 | 可获得任务成功和尾延迟指标 | 仿真不能替代真实集群 | 公开Trace、原型和端到端基准 |
文章的定量结果来自合成事件分布和解析传输模型,不代表某一GPU、模型或智能体框架的实测性能。真实部署还会受到KV布局、PCIe/CXL拓扑、NUMA、模型并行、前缀树碎片、工具并发和内核实现影响。后续研究应公开真实工具时长和事件依赖Trace,在vLLM或SGLang中实现原型,并在SWE-bench、OSWorld等任务[33][34]上同时测量作业完成时间、任务成功率和输出等价性。
6 结 论
智能体推理使KV缓存从请求级临时张量演化为跨轮次、跨工具和跨分支的执行状态。文章提出AgentKV,以事件图描述状态依赖和版本,以未来复用、重算代价、正确性权重、迁移成本及机会成本计算状态价值,并在GPU HBM、主机DDR/CXL和NVMe之间联合选择放置与精度。系统通过可逆压缩降低传输,通过工具间隙迁移和预测预取隐藏恢复,同时以风险代理触发完整副本、验证或重算回退。事件级仿真表明,在HBM预算为工作集35%的配置下,该方法相较LRU降低32.51%的P95恢复附加时延和71.68%的跨层传输量。更重要的结论是,智能体缓存系统不应把命中率作为唯一目标,而应在尾延迟、状态生命周期、可逆性和任务正确性之间建立可审计的联合优化。未来工作将围绕真实Agent Trace、跨节点CXL/网络拥塞、模型级KV验证和多租户安全隔离开展原型验证。
Lifecycle-aware KV cache for agentic inference
Abstract Agentic inference expands a single model invocation into a long-lived workflow of planning, tool execution, observation, verification, and retry. Consequently, the KV cache becomes cross-turn execution state rather than a request-local tensor. This paper presents AgentKV, a lifecycle-aware KV-cache system that annotates state pages with event-graph dependencies and versions, predicts reuse and recomputation costs, and jointly selects storage tier, compression precision, and restoration time across GPU HBM, host DDR/CXL memory, and NVMe. AgentKV further exploits tool-call gaps for migration, reversible compression, and predictive prefetching, while a risk controller preserves full references or recomputation checkpoints for correctness-sensitive states. In an event-level discrete simulation with 3,000 batches and 32 state blocks per batch, under an HBM budget equal to 35% of the working set, AgentKV reduces the P95 visible restoration delay from 5.59 ms to 3.77 ms and cross-tier transfer from 563.10 MB to 159.49 MB per batch compared with LRU, while hiding 50.28% of restoration work. The results show that agentic cache management should optimize lifecycle, reversibility, tail latency, and correctness risk jointly rather than maximizing hit rate alone.
参考文献
[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Long Beach: Curran Associates, 2017, 30: 5998-6008.
[2] YAO S, ZHAO J, YU D, et al. ReAct: synergizing reasoning and acting in language models[C]//International Conference on Learning Representations. Kigali: OpenReview, 2023.
[3] SCHICK T, DWIVEDI-YU J, DESSI R, et al. Toolformer: language models can teach themselves to use tools[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2023, 36: 68539-68551.
[4] KWON W, LI Z, ZHUANG S, et al. Efficient memory management for large language model serving with PagedAttention[C]//Proceedings of the 29th Symposium on Operating Systems Principles. New York: ACM, 2023: 611-626.
[5] ZHENG L, YIN L, XIE Z, et al. SGLang: efficient execution of structured language model programs[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
[6] AGRAWAL A, KARSAVURAN M O, KOLLAR T, et al. Taming throughputs-latency tradeoff in LLM inference with Sarathi-Serve[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 117-134.
[7] ZHONG Y, LIU S, CHEN J, et al. DistServe: disaggregating prefill and decoding for goodput-optimized large language model serving[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 193-210.
[8] QIN R, LI Z, HE W, et al. Mooncake: a KVCache-centric disaggregated architecture for LLM serving[C]//23rd USENIX Conference on File and Storage Technologies. Santa Clara: USENIX Association, 2025.
[9] PAN X, QIU M, TANG W, et al. KVFlow: efficient prefix caching for accelerating LLM-based multi-agent workflows[EB/OL]. arXiv:2507.07400, 2025[2026-09-03]. https://arxiv.org/abs/2507.07400.
[10] CHENG C, WANG Z, LIU Y, et al. LMCache: an efficient KV cache layer for enterprise-scale LLM inference[EB/OL]. arXiv:2510.09665, 2025[2026-09-03]. https://arxiv.org/abs/2510.09665.
[11] BIAN Z, WU F, MA T, et al. Tokencake: a KV-cache-centric serving framework for LLM-based multi-agent applications[EB/OL]. arXiv:2510.18586, 2025[2026-09-03]. https://arxiv.org/abs/2510.18586.
[12] LI H, HE R, MANG Q, et al. Continuum: efficient and robust multi-turn LLM agent scheduling with KV cache time-to-live[EB/OL]. arXiv:2511.02230, 2025[2026-09-03]. https://arxiv.org/abs/2511.02230.
[13] XIA T, LI H, LI Z, et al. Idleness is relative: exploiting tool-call idle windows for offloading in agentic systems with MORI[EB/OL]. arXiv:2606.00866, 2026[2026-09-03]. https://arxiv.org/abs/2606.00866.
[14] ZHENG H, FU F, WU J, et al. Efficient serving for dynamic agent workflows with prediction-based KV-cache management[EB/OL]. arXiv:2605.06472, 2026[2026-09-03]. https://arxiv.org/abs/2605.06472.
[15] BIAN Z, WU F, ZHANG C, et al. TokenDance: scaling multi-agent LLM serving via collective KV cache sharing[EB/OL]. arXiv:2604.03143, 2026[2026-09-03]. https://arxiv.org/abs/2604.03143.
[16] HUANG W, ZHANG J, ZHENG X. CommitKV: lifecycle-aware KV cache compression via commit transitions for multi-turn agents[EB/OL]. arXiv:2608.07855, 2026[2026-09-03]. https://arxiv.org/abs/2608.07855.
[17] LI J, LOU J, LI J. IntentKV: cross-turn intent-aware KV cache pruning for agent inference[EB/OL]. arXiv:2606.09916, 2026[2026-09-03]. https://arxiv.org/abs/2606.09916.
[18] YAO J, SHEN S, DU K, et al. VeriCache: turning lossy KV cache into lossless LLM inference[EB/OL]. arXiv:2605.17613, 2026[2026-09-03]. https://arxiv.org/abs/2605.17613.
[19] LIU Z, YUAN J, JIN H, et al. KIVI: a tuning-free asymmetric 2bit quantization for KV cache[C]//International Conference on Machine Learning. Vienna: PMLR, 2024.
[20] HOOPER C, KIM S, MOHAMMADZADEH H, et al. KVQuant: towards 10 million context length LLM inference with KV cache quantization[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
[21] ZHANG Z, SHENG Y, ZHOU T, et al. H2O: heavy-hitter oracle for efficient generative inference of large language models[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2023, 36: 34661-34710.
[22] XIAO G, TIAN Y, CHEN B, et al. Efficient streaming language models with attention sinks[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[23] LI Y, HUANG Y, YANG B, et al. SnapKV: LLM knows what you are looking for before generation[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
[24] LIU Y, LI H, CHENG Y, et al. CacheGen: KV cache compression and streaming for fast large language model serving[C]//Proceedings of the ACM SIGCOMM 2024 Conference. New York: ACM, 2024: 38-56.
[25] LEE W, LEE J, KIM J, et al. InfiniGen: efficient generative inference of large language models with dynamic KV cache management[C]//18th USENIX Symposium on Operating Systems Design and Implementation. Santa Clara: USENIX Association, 2024: 155-172.
[26] JIANG H, WU Q, LIN C Y, et al. LLMLingua: compressing prompts for accelerated inference of large language models[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Singapore: ACL, 2023: 13358-13376.
[27] DING Y, JIANG L, ZHENG X, et al. LongLLMLingua: accelerating and enhancing LLMs in long context scenarios via prompt compression[C]//Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. Bangkok: ACL, 2024: 1658-1677.
[28] CHEN L, ZAHARIA M, ZOU J. FrugalGPT: how to use large language models while reducing cost and improving performance[EB/OL]. arXiv:2305.05176, 2023[2026-09-03]. https://arxiv.org/abs/2305.05176.
[29] SHENG Y, ZHENG L, YUAN B, et al. FlexGen: high-throughput generative inference of large language models with a single GPU[C]//International Conference on Machine Learning. Honolulu: PMLR, 2023, 202: 31094-31116.
[30] MEGIDDO N, MODHA D S. ARC: a self-tuning, low overhead replacement cache[C]//2nd USENIX Conference on File and Storage Technologies. San Francisco: USENIX Association, 2003: 115-130.
[31] COMPUTE EXPRESS LINK CONSORTIUM. Compute Express Link specification revision 3.1[S/OL]. Beaverton: CXL Consortium, 2023[2026-09-03].
[32] OPENAI. A practical guide to building agents[R/OL]. San Francisco: OpenAI, 2025[2026-09-03].
[33] JIMENEZ C E, YANG J, WETTIG A, et al. SWE-bench: can language models resolve real-world GitHub issues?[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[34] XIE T, ZHANG D, CHEN J, et al. OSWorld: benchmarking multimodal agents for open-ended tasks in real computer environments[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
