摘要
面向大模型的FP4计算正在形成MXFP4、NVFP4及厂商专用变体并存的硬件生态。不同格式在块大小、尺度类型、异常值处理和原生矩阵指令方面存在差异,使针对单一平台生成的量化模型难以无损迁移,且离线精度最优的格式未必具有最低端到端代价。针对该问题,文章提出可迁移FP4量化框架TransFP4。该框架建立硬件无关的微缩放格式中间表示,采用块内正交整形、稀疏残差通道和逐块FP4/INT4候选选择,在部署阶段结合目标加速器的原生格式、转换融合能力、内存流量和内核代价进行后端晚绑定。基于131 072维重尾合成权重与激活张量的数值实验表明,在激活异常值比例为1%的条件下,TransFP4的归一化均方误差为0.004 60,分别较MXFP4、NVFP4和INT4降低84.15%、44.92%和82.91%;余弦相似度达到0.997 71。解析后端模型显示,TransFP4在NVFP4、MXFP4和INT4原生平台上的归一化执行代价分别为1.06、1.05和1.08。研究表明,FP4部署不能只优化单一数值格式,应把分布整形、格式描述、内核融合和跨平台转换纳入同一编译决策。
大模型推理在解码阶段频繁读取权重,参数位宽直接影响显存容量、内存带宽和单位Token能耗。INT8、INT4和权重量化已形成较成熟的方法体系[2][3][4][5][6][7][8][9],但新一代加速器开始提供原生FP4矩阵计算,使“数值格式本身”成为算法、编译器和硬件共同约束的对象。OCP微缩放格式以小块共享尺度扩展窄浮点动态范围[11][12];NVIDIA NVFP4采用16元素E2M1块、E4M3块尺度和全局尺度[13],AMD CDNA 4则原生支持包括MXFP4在内的标准微缩放类型[14]。这些格式具有相同的4 bit元素宽度,却并非二进制兼容:块大小、尺度码本、舍入规则、尺度层级和矩阵指令都不同。MR-GPTQ证明FP4需要格式专用旋转和量化过程[15],Diagnosing FP4进一步显示不同层及投影矩阵的敏感度不均匀[16],MixFP4、M2XFP和AdaMX则通过混合码本或少量元数据恢复精度[17][19][20]。由此产生新的系统矛盾:若模型工件绑定某一格式,跨平台迁移需要重新校准甚至重新量化;若始终保留通用INT4,又无法充分使用原生FP4吞吐。文章提出TransFP4,把量化结果表示为“硬件无关分布整形+块级格式意图+可选残差流”,并在目标后端完成晚绑定。贡献包括:①定义覆盖MXFP4、NVFP4和INT4的格式中间表示;②提出块内正交整形与稀疏残差联合的候选生成方法;③建立精度、有效位宽、转换开销和内核代价联合目标;④通过重尾张量数值实验和解析后端模型验证跨平台权衡。
1 FP4格式差异与迁移问题
1.1 微缩放表示
设长度为G的块x=(x₁,…,xG),元素格式为f,块尺度为sb,可选全局尺度为s_g,则微缩放量化可写为:
其中Q_f把归一化值映射到E2M1、INT4或其他窄码本。共享尺度承担动态范围,元素码本承担块内相对精度。相比逐张量尺度,微缩放可减少异常值对整张量的污染;但G越小,尺度元数据越多,矩阵装载和尺度广播也越复杂。MXFP4通常使用32元素块与E8M0幂次尺度,尺度乘法可简化为指数移位,但幂次取整会引入较大的尺度失配;NVFP4使用更细的16元素块与E4M3尺度,并叠加全局尺度,能提高块级拟合能力,却需要更复杂的反量化路径[11][12][13][14][15]。

图1 FP4微缩放格式及TransFP4统一描述
表1 典型4 bit格式的关键差异
| 格式 | 元素表示 | 块大小 | 尺度表示 | 主要优势 | 迁移障碍 |
|---|---|---|---|---|---|
| MXFP4 | E2M1 | 32 | E8M0幂次尺度 | 开放规范、尺度路径简单 | 尺度取整误差,需原生MX指令 |
| NVFP4 | E2M1 | 16 | E4M3块尺度+全局尺度 | 块更细、尺度尾数更丰富 | 两级尺度与厂商内核绑定 |
| INT4 | 有符号整数 | 16~128 | FP16/FP32组尺度 | 软件生态成熟、后端覆盖广 | 动态范围有限,不能直接用FP4矩阵路径 |
| 混合FP4/INT4 | 块级选择 | 可变 | 与主格式共享或附加标签 | 适应块间异质性 | 需要格式标签和统一解码数据通路 |
| TransFP4 IR | 逻辑码本描述 | 可变 | 尺度语义与物理编码分离 | 一次校准、多后端晚绑定 | 依赖编译器成本模型和融合内核 |
1.2 低比特浮点不是低比特整数的直接替换
传统INT4方法常通过通道平滑、异常值迁移或正交旋转把极端值摊薄[4][6][7][32]。对于均匀整数码本,旋转后能减小组内最大值并提高有效分辨率;对于MXFP4,块尺度只能取2的幂次,旋转后的能量扩散可能让更多块跨越尺度边界,反而放大误差。MR-GPTQ用块内旋转而非全局旋转缓解这一冲突[15],BATQuant也强调块级优化的重要性[22]。NVFP4的块更小,极端值被局部化,但过小分组会削弱“把少量异常值分散到更多通道”的收益。可见,同一预处理对不同FP4格式可能产生相反结果。

图2 E2M1与INT4归一化码点示意
图2显示E2M1码点非均匀,零附近和高幅值区间的间隔不同;INT4则在给定尺度下均匀分布。量化算法若仍以均匀网格假设设计舍入、二阶重构和误差补偿,就会错误估计FP4的局部敏感度。FAAR、M2XFP和MixFP4分别从格式感知舍入、附加元数据和混合码本切入[17][20],但其模型工件通常仍绑定特定编码。TransFP4的目标不是再发明一个唯一FP4格式,而是保留跨后端可重新解释的量化意图。
1.3 可迁移量化的约束
量化可迁移性至少包含三层含义。第一,数值可迁移:同一校准结果能够降低为不同块大小和尺度类型,而不会完全重做逐层优化;第二,执行可迁移:目标后端能将尺度、残差和格式标签融合到GEMM、GEMV或Attention入口,避免在内存中显式展开高精度张量;第三,评价可迁移:模型质量、显存、实际内核时延和格式转换开销采用统一指标,避免只报告离线困惑度而忽略运行时。表2给出现有方法的主要绑定点。
表2 量化方法与硬件绑定关系
| 方法 | 核心机制 | 常见目标格式 | 模型侧改动 | 跨后端复用 |
|---|---|---|---|---|
| SmoothQuant | 激活离线平滑 | W8A8/INT8 | 权重重参数化 | 中 |
| AWQ/GPTQ | 权重敏感度或二阶重构 | INT4权重 | 量化权重与组尺度 | 较高 |
| QuaRot/SpinQuant | 正交旋转消除异常值 | INT4/混合精度 | 插入或吸收旋转 | 中 |
| MR-GPTQ | 块内旋转与格式专用GPTQ | MXFP4/NVFP4 | 格式专用权重布局 | 较低 |
| MixFP4/AdaMX | 块级码本或恢复策略选择 | 专用混合FP4 | 新标签/解码器 | 低 |
| TransFP4 | 格式IR、残差流与后端晚绑定 | FP4或INT4原生格式 | 硬件无关逻辑工件 | 高 |
2 TransFP4框架设计
2.1 总体流程
TransFP4由离线画像、分布整形、块级候选生成、格式IR序列化和后端降低五个阶段组成,如图3所示。离线阶段只依赖模型张量、少量校准激活和抽象格式集合,不依赖某一厂商的物理指令;部署阶段读取目标后端能力,包括原生码本、矩阵Tile形状、尺度装载方式、融合边界、内存带宽和格式转换吞吐,并据此选择物理编码。该分层类似编译器把高层算子语义与目标指令分离,但IR还需保存量化误差和恢复路径。

图3 TransFP4量化与后端晚绑定流程
2.2 格式中间表示
每个逻辑量化块表示为bj=〈Gj,Cj,Sj,Rj,Πj,Ωj〉。Gj为逻辑块大小;Cj给出候选码本集合;Sj描述尺度语义而非物理位串;Rj描述残差通道的索引与精度;Πj记录可吸收的正交变换和通道排列;Ω_j保存校准统计、候选误差、访问频次及目标算子。物理后端可以把一个逻辑块拆成两个16元素NVFP4块,也可以合并为32元素MXFP4块;若误差超限,则选择INT4或提高少量残差精度。
表3 TransFP4格式IR字段
| 字段 | 语义 | 示例 | 后端用途 |
|---|---|---|---|
| block_shape | 逻辑分块和矩阵轴 | 1×32、16×16 | 匹配矩阵Tile和尺度广播 |
| codebook_set | 允许的元素码本 | E2M1、INT4 | 选择原生低比特指令 |
| scale_semantics | 尺度计算和组合规则 | absmax、两级尺度 | 生成E8M0、E4M3或FP16尺度 |
| transform | 旋转、排列和吸收位置 | 32点Hadamard | 决定离线吸收或在线融合 |
| residual_lane | 异常值索引、精度与预算 | 每32值保留1个FP16 | 生成稀疏补偿流 |
| error_profile | NMSE、余弦、层敏感度 | 多候选代价向量 | 完成目标相关格式搜索 |
| kernel_contract | 算子、形状和对齐约束 | GEMM K维32对齐 | 选择融合内核或安全回退 |
2.3 块内整形与稀疏残差
对于逻辑块xj,TransFP4采用正交矩阵Hj执行局部变换yj=Hjxj。由于Hj保持二范数,有:
式(2)说明可以在变换域直接比较候选量化误差。与全层旋转不同,块内Hadamard不把异常值能量扩散到大量共享尺度块,且H_j可在权重侧离线吸收或在激活入口以蝶形网络融合。对每个块,系统再选择绝对值最大的r个位置进入稀疏残差通道,主流使用FP4或INT4表示。残差通道不是永久固定:对于NVFP4后端,较细尺度可能已足以表达该块,编译器可删除残差;对于MXFP4或非原生回退后端,则保留少量FP16/BF16补偿。
其中P_r是选择r个位置的稀疏投影。该表达把异常值处理变成可显式预算的第二数据流,而不是依赖某种格式隐式吸收所有极端值。SqueezeLLM和OWQ已证明稀疏高精度补偿能够改善极低位权重量化[26][27];TransFP4的区别在于补偿流与候选码本共同记录在IR中,后端可以根据原生能力消除、融合或改变精度。
2.4 格式搜索与后端降低
第j个块的候选决策包括物理格式fj、尺度方案sj、残差精度rj和内核kj。优化目标为:
ΔLj由二阶权重重构、激活NMSE和层敏感度近似;Tj、Ej分别为目标内核时延和能耗;Cj^convert表示显式格式转换、尺度重排和元数据解码的代价;Beff限制有效存储位宽,Rtask限制任务风险。实际搜索按层分两步进行:先用误差阈值剪除不合格候选,再用动态规划或整数规划分配全局残差预算。对于大模型,可把候选缩减为“原生FP4、原生INT4、FP4+残差、高精度回退”四类,使编译时间与块数近似线性。

图4 层类型与网络深度的敏感度画像示例
图4展示格式搜索使用的归一化敏感度示例。近期诊断研究显示MLP上、下投影往往比注意力投影更敏感,且敏感层不一定只集中在网络末端[16]。因此,TransFP4不采用“最后若干层保持高精度”的固定规则,而是将算子类型、网络深度、激活异常值和二阶曲率共同映射为层级风险预算。该画像应由真实模型校准获得;图4仅说明IR如何表达非均匀敏感度。
2.5 有效位宽与转换融合
对于元素位宽be、每G个元素共享bs位尺度、每G个元素附加b_t位格式或残差标签的编码,有效位宽为:

图5 块大小与有效存储位宽
图5说明减小块大小会提高尺度开销;额外2 bit格式标签若按块分摊,代价随G增大而迅速下降。更关键的是,元数据不能作为独立张量被反复读取。TransFP4要求后端把尺度、标签和残差索引与权重预打包,并在矩阵装载阶段解码;若目标硬件不支持混合码本,则编译器选择单一原生格式,避免逐块分支破坏流水线。格式转换也应尽量与预取、解包或GEMM入口融合,而不是先生成完整BF16中间张量。
3 数值实验与解析模型
3.1 实验边界
文章进行张量级数值实验,用于验证格式差异、块内整形和候选选择的方向性,不把结果表述为完整模型准确率或真实GPU吞吐。权重张量由标准差0.55的高斯主体与稀疏大幅异常值构成;激活张量采用自由度5的Student-t主体,并叠加异常值。每个张量含131 072个元素,异常值比例取0、0.1%、0.3%、1%、3%和6%,随机种子固定。所有方法以逐块absmax尺度和最近舍入为基础;TransFP4使用32点Hadamard、每32值最多1个残差候选,并在NVFP4与INT4候选中依据块误差选择。
表4 张量级实验设置
| 项目 | 设置 | 目的 |
|---|---|---|
| 张量长度 | 131 072 | 获得稳定的块级误差统计 |
| 权重主体 | N(0,0.55²) | 模拟近似钟形权重分布 |
| 激活主体 | 0.42×t(5) | 模拟重尾激活分布 |
| 异常值幅度 | N(0,6²)叠加 | 形成可控的极端值压力 |
| 异常值比例 | 0~6% | 覆盖稀疏到高密度异常值 |
| 候选方法 | MXFP4、NVFP4、INT4、旋转MXFP4、TransFP4 | 比较格式和整形策略 |
| 评价指标 | NMSE、余弦相似度、有效位宽、后端代价 | 同时观察数值与执行代理 |
| 结果性质 | 合成张量数值实验+解析成本模型 | 不等同真实模型任务或硬件实测 |
3.2 评价指标
归一化均方误差定义为NMSE=||x-x_hat||²₂/||x||²₂,余弦相似度用于衡量方向保持。NMSE能够比较不同张量幅度,余弦相似度对后续线性层的方向偏差更敏感。解析后端模型把本平台原生格式的矩阵执行代价归一化为1,并叠加非原生格式的解码、重排和显式转换成本;该模型不包含具体芯片频率、缓存命中和调度噪声,只回答“是否存在一个在三个后端上均接近原生路径的逻辑工件”。
4 结果与分析
4.1 异常值敏感性

图6 激活异常值比例与量化误差
图6显示,MXFP4和INT4的NMSE随异常值比例上升显著恶化;NVFP4由于16元素分组和E4M3尺度,误差保持相对稳定;旋转MXFP4能降低重尾条件下的误差,但无异常值时与基础MXFP4接近,说明旋转并非无条件有益。TransFP4通过局部整形、候选码本和稀疏残差取得最低NMSE,并且曲线随异常值比例变化较平缓。该结果与“FP4需要格式感知方法”的已有观察一致[15][16][17],但不证明在所有模型层或任务上都具有同等收益。
表5 代表性重尾条件下的数值结果
| 张量 | 方法 | NMSE | 余弦相似度 | 相较TransFP4的NMSE倍数 |
|---|---|---|---|---|
| 激活1% | MXFP4 | 0.02901 | 0.98548 | 6.31 |
| 激活1% | NVFP4 | 0.00835 | 0.99583 | 1.82 |
| 激活1% | INT4 | 0.02690 | 0.98668 | 5.85 |
| 激活1% | 旋转MXFP4 | 0.01214 | 0.99391 | 2.64 |
| 激活1% | TransFP4 | 0.00460 | 0.99771 | 1.00 |
| 权重0.3% | MXFP4 | 0.02155 | 0.98920 | 4.15 |
| 权重0.3% | NVFP4 | 0.00889 | 0.99556 | 1.71 |
| 权重0.3% | INT4 | 0.01864 | 0.99076 | 3.59 |
| 权重0.3% | 旋转MXFP4 | 0.01273 | 0.99362 | 2.45 |
| 权重0.3% | TransFP4 | 0.00519 | 0.99741 | 1.00 |
在激活异常值比例为1%时,TransFP4的NMSE为0.00460,相较MXFP4、NVFP4和INT4分别降低84.14%、44.92%和82.90%。在权重异常值比例为0.3%时,TransFP4的NMSE为0.00519,余弦相似度为0.99741。由于TransFP4使用额外残差候选,其优势不能被解释为“免费精度”;式(6)的有效位宽和后端数据流必须共同评价。
4.2 后端可迁移性

图7 不同原生后端的归一化执行代价
解析模型中,直接执行本平台原生格式的代价设为1。NVFP4工件迁移到MX原生和INT4后端时,需重组块尺度并解码两级尺度,代价分别为1.28和1.75;MXFP4工件迁移到NV原生和INT4后端时,代价为1.32和1.62。TransFP4在三个后端上分别为1.06、1.05和1.08,因为格式IR允许后端选择本地码本,并把残差或尺度转换吸收到矩阵入口。该结果是结构化成本假设,不是对特定GPU的测量,主要说明晚绑定可以避免最差的跨格式路径。
表6 后端归一化执行代价
| 后端 | NVFP4工件 | MXFP4工件 | INT4工件 | TransFP4工件 |
|---|---|---|---|---|
| NV原生后端 | 1.00 | 1.32 | 1.15 | 1.06 |
| MX原生后端 | 1.28 | 1.00 | 1.12 | 1.05 |
| INT4后端 | 1.75 | 1.62 | 1.00 | 1.08 |
可迁移不等于所有后端使用完全相同的物理比特流。TransFP4保存的是可复现的逻辑量化工件,包括变换、候选尺度和残差预算;安装或部署阶段仍需产生后端专用权重包。与从原始BF16模型重新校准相比,这一步不需要重新采样数据或运行逐层优化,但会增加一次离线重打包。对于模型分发平台,可同时缓存多个热门后端包,并以逻辑工件作为可验证源。
4.3 消融与边界分析
根据同一张量模型,关闭块内旋转会提高重尾块的尺度压力;关闭残差通道后,TransFP4趋近于“逐块择优FP4/INT4”;固定为单一码本会失去块间异质性;忽略转换成本则可能选择离线误差最低但运行时最慢的格式。表7给出方向性消融,数值以完整方案的NMSE或代价归一化,目的在于分离组件贡献。
表7 TransFP4方向性消融结果
| 配置 | NMSE归一值 | 后端代价归一值 | 主要影响 |
|---|---|---|---|
| 完整TransFP4 | 1.00 | 1.00 | 整形、候选、残差和成本模型全部开启 |
| 无块内整形 | 1.31 | 0.98 | 异常值提高共享尺度,数值误差增加 |
| 无稀疏残差 | 1.46 | 0.94 | 有效位宽降低,但敏感块失真 |
| 固定FP4码本 | 1.37 | 0.96 | 不能为近均匀块选择INT4 |
| 无层敏感度 | 1.18 | 1.00 | 残差预算分配到低风险层 |
| 忽略转换成本 | 0.97 | 1.29 | 离线误差略降,跨后端显式转换增加 |
5 编译实现与验证路线
5.1 与模型编译栈的集成
TransFP4可以作为MLIR、TVM或厂商图编译器中的量化方言。前端把PyTorch权重、校准统计和算子语义转换为逻辑块;中端执行变换吸收、尺度候选和全局预算搜索;后端根据设备能力表完成物理编码。对于权重,Hadamard可与相邻权重矩阵离线相乘;对于激活,变换需要与RMSNorm、线性层入口或Attention投影融合。若后端缺少原生FP4,系统可降低到INT4或W4A16,而不通过软件仿真FP4追求名义格式一致。
内核契约应显式描述K维对齐、矩阵Tile、累加精度、尺度装载频率、稀疏残差吞吐和输出类型。NVIDIA Transformer Engine已经把NVFP4尺度配方和矩阵接口集成到Transformer组件[13][34],AMD CDNA 4提供指数块尺度矩阵指令[14][35]。跨平台编译器需要避免把这些接口的最小公分母当作唯一抽象,否则会丢失本地融合能力。正确方法是保留多个合法降低规则,并由成本模型选择。
5.2 正确性与可审计模型工件
低比特模型发布需要保存高于“权重文件+量化配置”的审计信息,包括原始模型哈希、Tokenizer和旋转配置、校准数据摘要、每层候选误差、后端包生成器版本、随机种子及回退格式。逻辑工件到物理包的转换应产生确定性清单,允许验证每个块采用何种码本、尺度和残差。对安全敏感任务,可为关键层保留BF16检查点或在长推理中周期性执行高精度校验,避免量化误差沿多步推理累积。
5.3 局限性
文章的数值实验使用合成张量,尚未覆盖真实大模型层间误差传播、困惑度、代码和数学推理准确率,也未实现B200、MI355X或其他芯片上的原生融合内核。解析后端代价仅用于比较数据路径,不代表任何产品的绝对性能。未来应在Llama、Qwen和推理模型上采用统一校准集,测量WikiText2困惑度、MMLU、GSM8K、代码生成、长上下文和多轮任务,并对比端到端首Token时延、Token吞吐、功率、模型包大小及后端编译时间。另一方面,块级混合格式会增加验证空间和硬件控制复杂度;当分支或元数据开销超过精度收益时,编译器应退化到单一原生格式。
6 结 论
FP4不是一个单一、可互换的4 bit数据类型,而是由元素码本、块大小、尺度语义、异常值机制和原生矩阵路径共同定义的软硬件契约。文章提出TransFP4,以硬件无关格式IR保存分布整形、码本候选、尺度意图和稀疏残差,在部署阶段结合目标加速器完成后端晚绑定。重尾合成张量实验显示,该方案在代表性权重和激活条件下显著降低NMSE;解析成本模型显示,其在NVFP4、MXFP4和INT4后端上均可保持接近本地原生路径的执行代价。研究的核心结论是,未来低比特模型不应被封装成绑定单一芯片的静态权重文件,而应成为可由编译器验证、降低和重打包的可迁移数值程序。后续工作需以真实模型、原生内核和任务级正确性验证这一设计,并研究训练阶段直接生成可迁移FP4工件的可能性。
Portable FP4 quantization for heterogeneous accelerators
Abstract Native FP4 acceleration is emerging through mutually incompatible microscaling formats such as MXFP4 and NVFP4. Their block size, scale encoding, outlier behavior, and matrix instructions differ, so a quantized artifact optimized for one accelerator may require recalibration or expensive conversion on another. This paper presents TransFP4, a portable FP4 quantization framework with a hardware-independent format intermediate representation. It combines block-local orthogonal shaping, a sparse residual lane, and per-block FP4/INT4 candidate selection, while deferring the physical scale encoding and kernel choice to the deployment backend. The optimization jointly accounts for numerical distortion, effective bit width, kernel cost, energy proxy, and format-conversion overhead. In numerical experiments on 131,072-element synthetic heavy-tailed weight and activation tensors, at a 1% activation-outlier ratio, TransFP4 obtains an NMSE of 0.00460 and a cosine similarity of 0.99771, reducing NMSE by 84.15%, 44.92%, and 82.91% relative to MXFP4, NVFP4, and INT4, respectively. An analytical backend model gives normalized execution costs of 1.06, 1.05, and 1.08 on NVFP4-native, MXFP4-native, and INT4-native targets. These results are tensor-level numerical and analytical evidence rather than full-model hardware measurements. They indicate that portable low-bit deployment requires quantization, format description, conversion fusion, and backend lowering to be optimized together.
参考文献
[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Long Beach: Curran Associates, 2017, 30: 5998-6008.
[2] DETTMERS T, LEWIS M, BELKADA Y, et al. LLM.int8(): 8-bit matrix multiplication for transformers at scale[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2022, 35: 30318-30332.
[3] FRANTAR E, ASHKBBOOS S, HOEFLER T, et al. GPTQ: accurate post-training quantization for generative pre-trained transformers[C]//International Conference on Learning Representations. Kigali: OpenReview, 2023.
[4] XIAO G, LIN J, SEZNEC M, et al. SmoothQuant: accurate and efficient post-training quantization for large language models[C]//International Conference on Machine Learning. Honolulu: PMLR, 2023, 202: 38087-38099.
[5] LIN J, TANG J, TANG H, et al. AWQ: activation-aware weight quantization for on-device LLM compression and acceleration[C]//Proceedings of Machine Learning and Systems. Santa Clara: MLSys, 2024, 6: 87-100.
[6] ASHKBBOOS S, MARKOV I, FRANTAR E, et al. QuaRot: outlier-free 4-bit inference in rotated LLMs[C]//Advances in Neural Information Processing Systems. Vancouver: Curran Associates, 2024, 37.
[7] LIU Z, ZHAO C, FENG I, et al. SpinQuant: LLM quantization with learned rotations[C]//International Conference on Learning Representations. Singapore: OpenReview, 2025.
[8] ZHAO Y, LIN C Y, ZHANG K, et al. Atom: low-bit quantization for efficient and accurate LLM serving[C]//Proceedings of Machine Learning and Systems. Santa Clara: MLSys, 2024, 6.
[9] LIN Y, TANG H, YANG S, et al. QServe: W4A8KV4 quantization and system co-design for efficient LLM serving[C]//Proceedings of Machine Learning and Systems. Santa Clara: MLSys, 2025, 7.
[10] LIU S Y, LIU Z, HUANG X, et al. LLM-FP4: 4-bit floating-point quantized transformers[EB/OL]. arXiv:2310.16836, 2023[2026-09-03]. https://arxiv.org/abs/2310.16836.
[11] DARVISH ROUHANI B, ZHAO R, MORE A, et al. Microscaling data formats for deep learning[EB/OL]. arXiv:2310.10537, 2023[2026-09-03]. https://arxiv.org/abs/2310.10537.
[12] OPEN COMPUTE PROJECT. OCP microscaling formats (MX) specification version 1.0[S/OL]. San Jose: Open Compute Project, 2023[2026-09-03].
[13] NVIDIA. NVFP4 data format and scaling recipe[EB/OL]. Santa Clara: NVIDIA Transformer Engine Documentation, 2026[2026-09-03].
[14] AMD. Introducing AMD CDNA 4 architecture[R/OL]. Santa Clara: Advanced Micro Devices, 2025[2026-09-03].
[15] EGIAZARIAN V, CASTRO R L, KUZNEDELEV D, et al. Bridging the gap between promise and performance for microscaling FP4 quantization[EB/OL]. arXiv:2509.23202, 2025[2026-09-03]. https://arxiv.org/abs/2509.23202.
[16] CIM M, et al. Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4[EB/OL]. arXiv:2603.08747, 2026[2026-09-03]. https://arxiv.org/abs/2603.08747.
[17] ZOU J, et al. MixFP4: enhancing NVFP4 with adaptive FP4/INT4 block formats[EB/OL]. arXiv:2605.31035, 2026[2026-09-03]. https://arxiv.org/abs/2605.31035.
[18] LIU W, MENG H, LUO Y, et al. MicroMix: efficient mixed-precision quantization with microscaling formats for large language models[EB/OL]. arXiv:2508.02343, 2025[2026-09-03]. https://arxiv.org/abs/2508.02343.
[19] LUO J, JIANG X, WEN T H, et al. Heterogeneity-aware microscaling for efficient low-bit LLM inference[EB/OL]. arXiv:2608.03867, 2026[2026-09-03]. https://arxiv.org/abs/2608.03867.
[20] HU W, ZHANG Z, ZHANG H, et al. M2XFP: a metadata-augmented microscaling data format for efficient low-bit quantization[C]//Proceedings of the 31st ACM International Conference on Architectural Support for Programming Languages and Operating Systems. New York: ACM, 2026.
[21] LEE J, PARK J, KIM J, et al. AMXFP4: taming activation outliers with asymmetric microscaling floating-point for 4-bit LLM inference[EB/OL]. arXiv:2411.09909, 2024[2026-09-03]. https://arxiv.org/abs/2411.09909.
[22] LI J F, ZHANG M, XIA X, et al. BATQuant: outlier-resilient MXFP4 quantization via learnable block-wise optimization[EB/OL]. arXiv:2603.16590, 2026[2026-09-03]. https://arxiv.org/abs/2603.16590.
[23] CHMIEL B, FISHMAN M, BANNER R, et al. FP4 all the way: fully quantized training of large language models[EB/OL]. arXiv:2505.19115, 2025[2026-09-03]. https://arxiv.org/abs/2505.19115.
[24] GORODECKY D, SOUSA L. Hardware for converting floating-point to the microscaling format[EB/OL]. arXiv:2411.03149, 2024[2026-09-03]. https://arxiv.org/abs/2411.03149.
[25] ZENG C, LIU S, XIE Y, et al. ABQ-LLM: arbitrary-bit quantized inference acceleration for large language models[EB/OL]. arXiv:2408.08554, 2024[2026-09-03]. https://arxiv.org/abs/2408.08554.
[26] KIM S, HOOPER C, GHOLAMI A, et al. SqueezeLLM: dense-and-sparse quantization[C]//International Conference on Machine Learning. Vienna: PMLR, 2024.
[27] LEE C, JIN J, KIM T, et al. OWQ: outlier-aware weight quantization for efficient fine-tuning and inference of large language models[C]//Proceedings of the AAAI Conference on Artificial Intelligence. Vancouver: AAAI Press, 2024, 38(12): 13355-13364.
[28] SHAO W, CHEN M, ZHANG Z, et al. OmniQuant: omnidirectionally calibrated quantization for large language models[C]//International Conference on Learning Representations. Vienna: OpenReview, 2024.
[29] MALINOVSKIY A, et al. PV-Tuning: beyond straight-through estimation for extreme LLM compression[EB/OL]. arXiv:2405.14852, 2024[2026-09-03].
[30] CHEE J, CAI Y, KWON W, et al. QuIP: 2-bit quantization of large language models with guarantees[C]//Advances in Neural Information Processing Systems. New Orleans: Curran Associates, 2023, 36.
[31] TSENG A, CHEE J, SUN Q, et al. QuIP#: even better LLM quantization with hadamard incoherence and lattice codebooks[C]//International Conference on Machine Learning. Vienna: PMLR, 2024.
[32] ZHAO R, HU Y, DOTZEL J, et al. Improving neural network quantization without retraining using outlier channel splitting[C]//International Conference on Machine Learning. Stockholm: PMLR, 2019, 97: 7543-7552.
[33] MICROSOFT. MicroXcaling reference implementation[CP/OL]. Redmond: Microsoft, 2024[2026-09-03].
[34] NVIDIA. Transformer Engine user guide, version 2.18[CP/OL]. Santa Clara: NVIDIA, 2026[2026-09-03].
[35] AMD. Matrix core programming on AMD CDNA 3 and CDNA 4 architectures[EB/OL]. Santa Clara: Advanced Micro Devices, 2025[2026-09-03].
