端侧神经网络处理器具有高能效矩阵阵列、紧耦合片上存储和异步DMA,但其静态图、有限动态形状、受限地址空间及功率热约束与大模型的自回归状态、可变序列和混合算子存在结构性冲突。
面向大模型的FP4计算正在形成MXFP4、NVFP4及厂商专用变体并存的硬件生态。