Research
面向MoE推理的Chiplet专家复用架构
混合专家大模型通过稀疏激活扩展参数容量,但Top-k路由会在Chiplet系统中形成专家热点、随机权重装载、片间散集通信和同步尾延迟。
面向智能体推理的生命周期感知KV缓存系统
智能体推理把一次模型调用扩展为规划、工具执行、观察回填、验证与重试组成的长生命周期工作流,使KV缓存由请求内临时张量转变为跨轮次执行状态。
面向异构加速器的可迁移FP4量化
面向大模型的FP4计算正在形成MXFP4、NVFP4及厂商专用变体并存的硬件生态。
面向端侧NPU的大模型编译优化
端侧神经网络处理器具有高能效矩阵阵列、紧耦合片上存储和异步DMA,但其静态图、有限动态形状、受限地址空间及功率热约束与大模型的自回归状态、可变序列和混合算子存在结构性冲突。
大模型推理的内存中心化架构演进
随着推理大模型、长上下文和智能体应用持续发展,推理系统的主要矛盾正由峰值计算能力不足转向模型权重、键值缓存、专家参数与中间状态在多级存储和互连网络中的高频迁移。