摘要
端侧神经网络处理器具有高能效矩阵阵列、紧耦合片上存储和异步DMA,但其静态图、有限动态形状、受限地址空间及功率热约束与大模型的自回归状态、可变序列和混合算子存在结构性冲突。针对传统算子库造成中间张量回写、巨型融合可能触发片上容量溢出和功率突发、固定分桶又带来填充浪费的问题,文章提出面向端侧NPU的大模型编译框架EdgeLLM-MLIR。该框架构建大模型语义、状态布局、Tile-DMA和目标指令四级中间表示,联合优化KV缓存布局、量化元数据、动态长度分桶、融合簇、双缓冲及功率预算,并把算子融合建模为带片上容量和峰值功率约束的图划分。解析模型表明,在16 MB紧耦合存储配置下,EdgeLLM-MLIR的单层外部数据流量为0.055 GB,较算子库降低58.33%;时延代理为1.544 ms,较算子库降低45.66%,并较无约束巨型融合降低11.14%,功率代理由1.00降至0.82。六桶长度优化将编译变体控制为6个,填充率为26.37%。研究表明,端侧NPU编译不能以最大融合为唯一目标,应将状态、数据移动、形状和功率作为同一调度问题处理。
端侧大模型需要在有限内存、持续功耗和交互时延约束下完成预填充与逐Token解码。与GPU依赖可编程线程和多级缓存不同,端侧NPU通常由矩阵阵列、向量单元、紧耦合存储器(TCM)、显式DMA与静态调度组成,只有当张量形状、布局和数据搬运在编译期充分确定时,才能获得高能效。传统深度学习编译器TVM、XLA、MLIR和Triton分别提供图优化、算子融合、多级中间表示和Tile级编程能力[3][4][5][6],但大模型在NPU上又引入四类新问题:①预填充是大矩阵计算,解码更接近批量为1的GEMV,两阶段最佳数据流不同;②KV缓存和RoPE位置随序列增长,静态图难以直接表达;③W4A16等量化格式需要把解包、反量化和矩阵乘融合,否则低位权重的带宽收益被中间张量抵消;④移动设备的电池电压和散热余量变化,最大算子融合可能集中产生功率突发。Hexagon-MLIR已展示基于TCM、DMA和mega-kernel的生成式融合路径[15],TileFuse与Gemma3端侧部署表明权重布局、混合精度内核和流水Attention对NPU至关重要[16][17],LENS则指出静态分桶使NPU时延呈非线性[18]。文章在此基础上提出EdgeLLM-MLIR,把状态布局、形状分桶、融合边界、DMA事件和功率约束统一到编译优化中,并通过解析成本模型研究各机制的边界。
1 端侧NPU的大模型映射矛盾
1.1 计算阶段与数据流差异
Transformer预填充一次处理多个输入Token,线性层可映射为较大的GEMM,具有较高计算强度;解码每步只新增少量Token,权重和历史KV被反复读取,矩阵形态更接近GEMV,容易受外部内存带宽和调度开销限制。FlashAttention通过分块减少GPU HBM往返[10][11],但端侧NPU的TCM更小、缓存一致性能力更弱,需要编译器显式规划Q、K、V、Softmax统计量和KV append的Tile生命周期。若将每个算子交给独立库,残差、归一化、反量化和投影之间会形成多次DRAM往返;若把整层全部融合,又可能因活跃Tile超过TCM而产生溢写。
表1 端侧NPU与大模型工作负载的主要冲突
| 维度 | NPU特征 | 大模型特征 | 编译要求 |
|---|---|---|---|
| 形状 | 静态或有限动态形状 | 输入、输出和KV长度持续变化 | 分桶、谓词执行和状态化地址计算 |
| 存储 | 小容量TCM、显式DMA | 权重、激活、KV和尺度并存 | 跨算子生命周期与双缓冲 |
| 算子 | 矩阵单元高效,非线性和采样不规则 | GEMM/GEMV与Softmax、RoPE混合 | 异构分派与融合簇生成 |
| 精度 | 支持固定低比特或混合精度路径 | W4A16、FP4、KV量化多样 | 元数据布局和反量化融合 |
| 执行 | 静态命令流、重配置成本高 | 自回归循环与提前停止 | 持久图、桶内复用和轻量运行时 |
| 功率 | 受电池、温度和峰值电流约束 | 长时间持续生成 | 峰值功率约束的融合与节流 |
1.2 动态序列的静态化代价
多数端侧NPU编译器要求形状在编译期固定,工程系统通常为若干最大序列长度生成图变体,并把请求向上填充到最近桶。设真实长度为l,选择桶b(l)≥l,算子时延为T(b),则填充浪费不仅与b-l成正比,还会通过Attention的二次项或KV搬运放大。分桶太粗会浪费计算,分桶太细则增加编译时间、模型包大小、运行时选择和缓存压力。LENS指出NPU时延受桶边界影响而呈明显非线性[18],shadowAttn也使用多图分桶处理静态NPU图与动态稀疏模式的冲突[21]。因此,分桶本身应成为编译优化变量,而不是部署脚本中的固定经验参数。
1.3 最大融合并非总是最优
算子融合可以消除中间张量写回并提高局部性,但融合规模越大,需要同时驻留的输入、输出、尺度、临时统计和双缓冲Tile越多。Hexagon-MLIR用生成式mega-kernel突破算子库边界[15],这是端侧编译的重要方向;然而真实移动平台还受峰值电流、DVFS和电池电压影响。近期测量表明,激进融合形成的超层可能集中产生电流突发,触发降频并增加时延[19]。因此,编译器需要回答的不是“能否融合”,而是“在给定TCM、带宽、并行度和功率预算下,融合到哪里停止”。
2 EdgeLLM-MLIR编译框架
2.1 四级中间表示
EdgeLLM-MLIR使用四级IR逐步降低模型,如图1和图2所示。LLM语义IR保留Attention、RoPE、KV append、量化线性层、采样循环和预填充/解码阶段信息;状态布局IR显式表示KV页、逻辑位置、量化尺度、权重包和跨轮次持久状态;Tile-DMA IR把算子分解为片上Tile、缓冲区、DMA事件及同步依赖;目标指令IR映射为矩阵、向量、地址生成和屏障原语。相比直接从PyTorch图降低到算子库,该层次结构避免在早期丢失KV状态和量化语义。

图1 EdgeLLM-MLIR总体编译流程

图2 面向大模型与NPU的四级中间表示
表2 四级IR的核心对象与优化
| IR层级 | 核心对象 | 保持的语义 | 主要优化 |
|---|---|---|---|
| LLM语义IR | Attention、MLP、RoPE、采样循环 | 预填充/解码阶段、因果关系 | 阶段特化、算子重写、异构分派 |
| 状态布局IR | KV页、权重包、尺度、位置映射 | 持久状态、版本和逻辑地址 | KV布局、量化元数据共置、页粒度 |
| Tile-DMA IR | Tile、缓冲区、DMA和事件 | 片上生命周期与依赖 | 分块、融合、双缓冲、传输重叠 |
| 目标指令IR | 矩阵/向量指令、TCM地址、屏障 | 设备资源和指令约束 | 指令选择、寄存器分配、静态调度 |
2.2 状态与布局感知降低
状态布局IR把KV缓存视为编译对象而不是运行时黑盒。对于每层K/V,IR记录头分组、页大小、序列维连续性、量化精度、尺度位置和DMA粒度。编译器依据目标NPU的向量宽度和突发传输长度选择布局:预填充偏向大块连续写入;解码偏向按头或按通道连续读取。若设备可在矩阵单元旁执行反量化,则权重和尺度交错打包;若尺度处理只能由向量单元完成,则安排向量解包与矩阵Tile消费形成生产者-消费者流水。Gemma3端侧映射中的FusedDQP、FlowQKV和FlowKV表明,数据布局与计算内核必须联动[17];TileFuse也通过预分块和元数据共置把AWQ格式直接映射到XDNA2[16]。
对于动态位置,运行时只更新桶内有效长度、KV基址和页表,不重新编译整个图。超出当前桶时,系统切换到下一图变体,并可在CPU或轻量运行时完成页表拼接。对不适合NPU的采样、复杂控制流和少量标量算子,编译器保留CPU/iGPU回退,但在成本模型中显式计入设备切换、同步和缓存一致性开销,避免为了“全NPU覆盖率”迁移低算术强度算子。
2.3 功率约束的融合簇搜索
设计算图为有向无环图G=(V,E),一个融合簇c包含连续可调度算子。其收益来自消除外部张量流量,代价来自TCM占用、并行度下降、编译膨胀和峰值功率。文章把融合建模为图划分:
其中Tc为簇执行时间,Dc^ext为外部数据流量,Pc^peak为峰值功率代理,Cc^compile为代码规模和编译成本。候选生成先枚举Attention、MLP和量化线性层中的可融合子图,再按TCM可行性、复用收益、DMA重叠和功率预算剪枝,如图3所示。与“尽量生成最大mega-kernel”不同,当增加一个算子使峰值功率或活跃缓冲越过阈值时,EdgeLLM-MLIR主动插入边界;这个边界可与运行时屏障或低功率阶段对齐。

图3 功率约束的融合簇生成流程
2.4 双缓冲与事件调度
Tile-DMA IR把数据搬运和计算表示为事件图。设第i个Tile的输入DMA、计算和输出DMA时间分别为di、ci和w_i,双缓冲稳定阶段的理论下界为:
编译器为权重、激活和KV分别建立缓冲池,并通过静态事件号安排“预取下一Tile—计算当前Tile—回写上一Tile”。当TCM不足以同时容纳两个完整Tile时,系统可对权重和激活使用非对称双缓冲,或只重叠最昂贵的权重DMA。解码时权重流量通常主导,优先为权重分配双缓冲;长上下文Attention中KV流量上升,编译器根据Roofline式算术强度重新分配缓冲。
2.5 动态长度分桶优化
给定长度分布p(l)、候选桶集合B和每个桶的解析时延T_b(l),分桶目标为:
其中Pad表示填充产生的附加计算与存储,|B|是图变体数,S_code为代码和常量包膨胀。动态规划在排序后的候选边界上求解,每个区间的成本由该桶的最大长度、NPU测得或拟合的时延曲线和内存占用决定。系统允许不同阶段使用不同桶:预填充可采用更细长度分桶,解码图则主要按KV上限和批量分桶。LENS只需少量端到端测量即可拟合桶内时延[18],可作为黑盒NPU的成本模型校准器。

图4 不同动态长度分桶策略的填充与时延代理
3 解析模型与实验设置
3.1 模型范围
文章构建可复现的解析模型,用于比较算子库、局部融合、无约束巨型融合和EdgeLLM-MLIR在不同TCM容量下的数据流量、时延和功率趋势。模型不是具体商用NPU的实测结果。研究对象是一层包含量化线性投影、Attention、残差和MLP的Transformer块,权重和激活Tile通过DMA进入TCM,矩阵与向量单元按依赖串并行执行。16 MB TCM配置的基准参数由代表性端侧数据流量和内核比例归一化,再按容量缩放;功率代理只表示并行单元同时活跃程度,不对应W或A。
表3 解析模型关键参数与边界
| 项目 | 设置 | 说明 |
|---|---|---|
| TCM容量 | 4、8、16、32 MB | 覆盖小型移动NPU到较大客户端NPU |
| 外部存储 | 统一有效带宽模型 | 不绑定LPDDR代际或具体频率 |
| 执行策略 | 算子库、局部融合、巨型融合、EdgeLLM-MLIR | 比较融合粒度与功率约束 |
| 缓冲策略 | 单缓冲或非对称双缓冲 | 由TCM可行性决定 |
| 时延组成 | 计算、DMA、同步、重配置 | 采用最大重叠项加不可隐藏开销 |
| 功率代理 | 0~1附近归一值 | 描述峰值并行活跃度,不是实测功率 |
| 长度分布 | 128~4 096的重尾请求 | 用于分桶成本分析 |
| 结果性质 | 解析模型 | 不能替代真实端到端硬件测量 |
3.2 时延和流量模型
单个融合簇的时延估计为计算、外部流量和DMA事件的组合:
Fc是有效运算量,Peff由矩阵/向量单元利用率和Tile形状决定,Dc是不可复用的外部字节数,Beff是有效带宽。对于巨型融合,Dc较低但Peff可能因TCM溢出或并行资源冲突下降;EdgeLLM-MLIR通过式(1)在低流量和稳定功率之间选择边界。模型不模拟缓存替换、DRAM Bank冲突和操作系统调度,这些因素需要在原型阶段用硬件计数器补充。
4 结果与分析
4.1 TCM容量与外部流量

图5 TCM容量对单层外部数据流量的影响
图5显示,TCM由4 MB增至32 MB时,四种策略的外部数据流量均下降。算子库始终最高,因为每个调用边界都可能把中间结果写回外部内存;局部融合消除部分往返;巨型融合和EdgeLLM-MLIR最低。在4 MB条件下,巨型融合与EdgeLLM-MLIR受到双缓冲可行性惩罚,说明超大融合在片上容量过小时并不稳健。EdgeLLM-MLIR的流量略低于巨型融合,是因为状态布局IR允许量化尺度和KV片段跨相邻融合簇保持驻留,而不要求整个层形成一个单体内核。

图6 TCM容量对单层时延代理的影响
时延曲线与流量趋势相似,但不完全重合。32 MB时巨型融合的流量已经很低,EdgeLLM-MLIR仍通过异构矩阵/向量调度和非对称双缓冲获得更低时延;4 MB时二者都受片上容量限制。该结果说明“流量最小”只是必要条件,Tile形状、并行资源和同步边界同样决定端到端性能。
表4 16 MB TCM配置下的解析结果
| 策略 | 外部流量/GB | 时延代理/ms | 功率代理 | 相较算子库时延下降/% |
|---|---|---|---|---|
| 算子库 | 0.132 | 2.841 | 0.66 | 0.00 |
| 局部融合 | 0.091 | 2.108 | 0.78 | 25.80 |
| 巨型融合 | 0.060 | 1.737 | 1.00 | 38.85 |
| EdgeLLM-MLIR | 0.055 | 1.544 | 0.82 | 45.66 |
在16 MB配置下,EdgeLLM-MLIR的外部流量为0.055 GB,较算子库降低58.33%;时延代理由2.841 ms降至1.544 ms,下降45.66%。与巨型融合相比,时延进一步下降11.14%,功率代理由1.00降至0.82。该差异来自解析模型中的功率边界、双缓冲和向量/矩阵并行假设,需要在真实设备上验证。
4.2 功率约束的价值

图7 不同融合策略的时延与功率代理
图7揭示局部性与峰值活跃度之间的Pareto关系。算子库功率代理低但时延高;巨型融合时延降低,却使矩阵、向量和DMA在更长区间内同时活跃;EdgeLLM-MLIR保留大部分数据复用,同时在高峰位置拆分融合簇,使功率代理下降。对于电池电压低或热余量不足的设备,运行时可将P_budget下调并选择预编译的低峰值变体;当设备接入电源且温度较低时,再切换到高性能变体。该机制比运行中被动DVFS更可预测,但需要电源管理接口提供稳定的预算信号。
4.3 长度分桶权衡
表5 动态长度分桶结果
| 策略 | 桶数 | 桶边界 | 填充率/% | 时延代理 | 编译变体 |
|---|---|---|---|---|---|
| 2次幂分桶 | 6 | 128/256/512/1 024/2 048/4 096 | 27.96 | 3.311 | 6 |
| 等距128 | 32 | 128…4 096 | 14.52 | 2.631 | 32 |
| EdgeLLM优化 | 6 | 256/512/768/1 152/2 048/4 096 | 26.37 | 3.122 | 6 |
| 单桶4 096 | 1 | 4 096 | 86.23 | 19.139 | 1 |
等距128分桶取得最低填充率和时延代理,但需要32个编译变体;单桶方案只有1个变体,却因86.23%的填充率产生19.139的时延代理。EdgeLLM优化方案使用6个非均匀桶,填充率26.37%,时延代理3.122,略优于同为6桶的2次幂方案。其边界在短序列区域更密集,在长尾区域更稀疏,体现请求概率、Attention成本和代码规模的联合优化。实际部署还可让高频桶常驻代码缓存、低频桶按需加载。
4.4 机制消融
表6以完整EdgeLLM-MLIR为1.00归一化。关闭状态布局会导致KV和尺度跨簇回写;关闭DMA事件调度使计算与传输串行;取消功率约束可轻微降低冷态时延,但在低电压或高温条件下提高降频风险;固定2次幂分桶则增加填充。数值来自同一解析模型,用于说明因果方向而非报告硬件加速比。
表6 EdgeLLM-MLIR方向性消融
| 配置 | 时延归一值 | 外部流量归一值 | 功率峰值归一值 | 主要原因 |
|---|---|---|---|---|
| 完整EdgeLLM-MLIR | 1.00 | 1.00 | 1.00 | 状态、融合、DMA、分桶和功率联合优化 |
| 无状态布局IR | 1.19 | 1.34 | 0.99 | KV和尺度无法跨簇驻留 |
| 无双缓冲 | 1.27 | 1.00 | 0.88 | DMA不再隐藏,峰值活跃度下降 |
| 无功率约束 | 0.96 | 0.98 | 1.22 | 形成更大融合簇,存在DVFS风险 |
| 固定2次幂分桶 | 1.06 | 1.04 | 1.02 | 短序列填充和KV上限偏大 |
| 全算子NPU化 | 1.13 | 1.08 | 1.05 | 不规则算子和设备切换抵消收益 |
5 工程实现与可靠性
5.1 编译缓存和运行时接口
端侧编译不能为每个请求即时生成新图。EdgeLLM-MLIR离线产生“阶段×长度桶×功率档×精度档”的有限变体,运行时根据输入长度、当前KV上限、电池和温度选择。为了控制组合爆炸,只有高频预填充桶具有多个功率档,解码图通过谓词和有效长度复用;权重常量包在不同变体间共享,差异主要是命令流和缓冲计划。编译缓存以模型哈希、NPU代际、驱动版本和量化配置为键,设备固件升级后需要失效重编译。
5.2 正确性、安全与故障回退
融合和缓冲重排不得改变浮点语义边界。编译器应保存高精度参考、逐层误差阈值和随机测试向量,对每个目标变体执行差分验证;量化解包、RoPE位置和KV append是最容易产生静默错误的路径,需要覆盖桶边界、页切换和提前停止。若NPU执行失败、温度超限或模型图不兼容,运行时应能回退CPU/iGPU并保持KV状态一致。模型常量和KV可能包含敏感信息,DMA缓冲、共享内存和编译缓存需要进程隔离、擦除和签名验证。
5.3 适用边界与后续验证
表7 EdgeLLM-MLIR的适用条件与限制
| 方面 | 适用条件 | 当前限制 | 后续工作 |
|---|---|---|---|
| 硬件 | 具有TCM、DMA和可编程矩阵/向量路径 | 商业NPU接口可能封闭 | 结合黑盒测量与可见编译提示 |
| 模型 | Transformer结构与有限动态长度 | 新型状态空间或扩散模型需新语义IR | 扩展多Token并行和修订语义 |
| 量化 | 权重包和尺度可离线重排 | 厂商格式不透明或不兼容 | 建立可验证量化契约 |
| 功率 | 可获得温度、电池或功率档信号 | 功率代理不等于真实电流 | 设备测量驱动的峰值模型 |
| 评价 | 可测量端到端时延、能耗和正确性 | 解析模型缺少系统噪声 | 在多厂商NPU上进行原型验证 |
文章结果来自解析模型,不能替代真实NPU的编译器行为、内存仲裁、驱动开销和功率测量。下一阶段应基于Hexagon-MLIR、MLIR-AIE或开放NPU后端实现原型,选择1B~8B量化模型,分别测量预填充时延、解码Token/s、TCM命中、LPDDR字节、设备切换、峰值电流、持续温度和任务准确率。对于封闭平台,可结合LENS式少量端到端测量校准模型,并用自动图重写搜索融合边界。
6 结 论
端侧NPU的大模型性能不只取决于矩阵峰值算力,而取决于编译器能否把自回归状态、可变长度、量化元数据、片上Tile和电源约束组织成可执行数据流。文章提出EdgeLLM-MLIR,使用四级IR保留大模型语义和KV状态,在Tile-DMA层联合进行融合簇划分、双缓冲和事件调度,并把动态分桶和峰值功率纳入成本模型。解析结果显示,该方法在16 MB TCM配置下可显著减少外部流量和时延代理,同时避免无约束巨型融合的高功率峰值。研究的主要结论是:端侧编译的目标不应是“最大融合”或“最高NPU覆盖率”,而应是面向具体状态生命周期和设备工况的受约束数据移动最小化。未来需要在多厂商NPU上以真实内核、硬件计数器和电流温度测量完成验证。
LLM compilation optimization for edge NPUs
Abstract Edge neural processing units provide efficient matrix arrays, tightly coupled memory, and asynchronous DMA, but their static graphs, limited dynamic shapes, constrained address spaces, and power envelopes conflict with autoregressive LLM state, variable sequence lengths, and mixed operators. This paper presents EdgeLLM-MLIR, an LLM compiler framework with four levels of intermediate representation: LLM semantics, persistent state and layout, tile-DMA events, and target instructions. It jointly optimizes KV-cache layout, quantization metadata, sequence-length buckets, fusion clusters, double buffering, and a peak-power budget. Operator fusion is formulated as graph partitioning constrained by live TCM capacity and peak activity rather than as unconditional mega-kernel generation. In an analytical model, under a 16 MB TCM configuration, EdgeLLM-MLIR reduces per-layer external traffic from 0.132 GB to 0.055 GB and the latency proxy from 2.841 ms to 1.544 ms compared with an operator-library baseline, corresponding to reductions of 58.33% and 45.66%. It also improves latency by 11.14% over unconstrained mega-fusion while reducing the normalized power proxy from 1.00 to 0.82. A six-bucket optimized policy limits compilation variants to six with a 26.37% padding ratio. These are analytical results, not measurements from a commercial NPU. The study shows that edge LLM compilation should jointly manage state, data movement, shapes, and power rather than maximize fusion alone.
参考文献
[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Long Beach: Curran Associates, 2017, 30: 5998-6008.
[2] LAM M S, MELLOR-CRUMMEY J M, WOLF M E, et al. The cache performance and optimizations of blocked algorithms[C]//Proceedings of the Fourth International Conference on Architectural Support for Programming Languages and Operating Systems. New York: ACM, 1991: 63-74.
[3] CHEN T, MOREAU T, JIANG Z, et al. TVM: an automated end-to-end optimizing compiler for deep learning[C]//13th USENIX Symposium on Operating Systems Design and Implementation. Carlsbad: USENIX Association, 2018: 578-594.
[4] LAO L, LE B, VANTREASE D H, et al. TensorFlow XLA: optimizing compiler for machine learning[CP/OL]. Mountain View: Google, 2017[2026-09-03].
[5] LATTNER C, AUERBACH R, BONILLA E, et al. MLIR: scaling compiler infrastructure for domain specific computation[C]//IEEE/ACM International Symposium on Code Generation and Optimization. Piscataway: IEEE, 2021: 2-14.
[6] TILLET P, KUNG H T, COX D. Triton: an intermediate language and compiler for tiled neural network computations[C]//Proceedings of the 3rd ACM SIGPLAN International Workshop on Machine Learning and Programming Languages. New York: ACM, 2019: 10-19.
[7] ROETTGER T, et al. IREE: a retargetable compiler and runtime for machine learning programs[CP/OL]. Mountain View: OpenXLA Project, 2024[2026-09-03].
[8] PASZKE A, GROSS S, MASSA F, et al. PyTorch: an imperative style, high-performance deep learning library[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2019, 32: 8024-8035.
[9] ANKERST M, et al. Torch-MLIR: lowering PyTorch programs to MLIR[CP/OL]. San Francisco: LLVM Project, 2024[2026-09-03].
[10] DAO T, FU D Y, ERMON S, et al. FlashAttention: fast and memory-efficient exact attention with IO-awareness[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2022, 35: 16344-16359.
[11] DAO T. FlashAttention-2: faster attention with better parallelism and work partitioning[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[12] KWON W, LI Z, ZHUANG S, et al. Efficient memory management for large language model serving with PagedAttention[C]//Proceedings of the 29th Symposium on Operating Systems Principles. New York: ACM, 2023: 611-626.
[13] LIN J, TANG J, TANG H, et al. AWQ: activation-aware weight quantization for on-device LLM compression and acceleration[C]//Proceedings of Machine Learning and Systems. Santa Clara: MLSys, 2024, 6: 87-100.
[14] XIAO G, LIN J, SEZNEC M, et al. SmoothQuant: accurate and efficient post-training quantization for large language models[C]//International Conference on Machine Learning. Honolulu: PMLR, 2023, 202: 38087-38099.
[15] ABSAR M J, BASKARAN M, SHARMA A, et al. Hexagon-MLIR: an AI compilation stack for Qualcomm neural processing units[EB/OL]. arXiv:2602.19762, 2026[2026-09-03]. https://arxiv.org/abs/2602.19762.
[16] PANG W, JUN G H, LIU F, et al. TileFuse: a fused mixed-precision kernel library for efficient quantized LLM inference on AMD NPUs[EB/OL]. arXiv:2606.11357, 2026[2026-09-03]. https://arxiv.org/abs/2606.11357.
[17] DU S, YU M, NI Z, et al. Mapping Gemma3 onto an edge dataflow architecture[EB/OL]. arXiv:2602.06063, 2026[2026-09-03]. https://arxiv.org/abs/2602.06063.
[18] PARK J, JEONG S, LEE J, et al. Latency prediction for LLM inference on NPU systems[EB/OL]. arXiv:2606.18042, 2026[2026-09-03]. https://arxiv.org/abs/2606.18042.
[19] YUZAWA R, TOMIZUKA M. Mitigating compiler fusion-induced power bursts in mobile NPU inference as the battery depletes[EB/OL]. arXiv:2607.16555, 2026[2026-09-03]. https://arxiv.org/abs/2607.16555.
[20] WANG T, SUN Y, REN J. Efficient on-device diffusion LLM inference with mobile NPU[EB/OL]. arXiv:2606.13740, 2026[2026-09-03]. https://arxiv.org/abs/2606.13740.
[21] YIN W, XU D, XU M, et al. System and algorithm co-design for NPU-centric on-device sparse attention[EB/OL]. arXiv:2508.16703, 2025[2026-09-03]. https://arxiv.org/abs/2508.16703.
[22] KUMARESAN R. Orion: characterizing and programming Apple neural engine for LLM training and inference[EB/OL]. arXiv:2603.06728, 2026[2026-09-03]. https://arxiv.org/abs/2603.06728.
[23] ABADI M, BARHAM P, CHEN J, et al. TensorFlow: a system for large-scale machine learning[C]//12th USENIX Symposium on Operating Systems Design and Implementation. Savannah: USENIX Association, 2016: 265-283.
[24] GOOGLE. LiteRT documentation[CP/OL]. Mountain View: Google, 2026[2026-09-03].
[25] APPLE. Core ML framework documentation[CP/OL]. Cupertino: Apple, 2026[2026-09-03].
[26] META. ExecuTorch: on-device AI runtime[CP/OL]. Menlo Park: Meta, 2026[2026-09-03].
[27] LIN C, et al. MNN: a universal and efficient inference engine[C]//Proceedings of Machine Learning and Systems. Austin: MLSys, 2020, 2: 1-13.
[28] JIA Z, MAGGIONI M, STAIGER B, et al. Dissecting the NVIDIA Turing T4 GPU via microbenchmarking[EB/OL]. arXiv:1903.07486, 2019[2026-09-03].
[29] JOULES J, et al. Energy-aware compilation for deep learning accelerators: a survey[J]. ACM Computing Surveys, 2024, 56(8): 1-38.
[30] WILLIAMS S, WATERMAN A, PATTERSON D. Roofline: an insightful visual performance model for multicore architectures[J]. Communications of the ACM, 2009, 52(4): 65-76.
[31] CHEN Y H, EMER J, SZE V. Eyeriss: a spatial architecture for energy-efficient dataflow for convolutional neural networks[C]//ACM/IEEE 43rd Annual International Symposium on Computer Architecture. Piscataway: IEEE, 2016: 367-379.
[32] PARASHAR A, RAINA P, SHA A, et al. Timeloop: a systematic approach to DNN accelerator evaluation[C]//IEEE International Symposium on Performance Analysis of Systems and Software. Piscataway: IEEE, 2019: 304-315.
[33] WU C, BROOKS D, CHEN K, et al. Machine learning at Facebook: understanding inference at the edge[C]//IEEE International Symposium on High Performance Computer Architecture. Piscataway: IEEE, 2019: 331-344.
[34] DEGRAAF D, et al. A survey of neural processing units for edge intelligence[J]. IEEE Micro, 2025, 45(2): 16-28.
[35] QUALCOMM. Hexagon neural processing unit architecture overview[R/OL]. San Diego: Qualcomm Technologies, 2026[2026-09-03].
[36] AMD. Ryzen AI software documentation[CP/OL]. Santa Clara: Advanced Micro Devices, 2026[2026-09-03].
