ICML 2026年论文评述合集(低优先级论文)
PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Fine-Grained Expert Merging and Bit-packed Inference
https://arxiv.org/pdf/2511.04805
将两个逻辑 MoE experts 在 element level 上融合到一个物理权重张量中: - 相似权重共享 magnitude:例如一个 expert 是 0.5 另一个是-0.48,就保留一个 0.49,最后推理时分裂成0.49 和-0.49 - 不相似权重保留 saliency 更高的一侧
并利用 BF16 未充分使用的 exponent/sign bits 内嵌两个 expert 的 mask 和 sign,配合 fused decode-GEMM 实现约 2× expert-weight compression 和最高 1.8× E2E throughput。实验平台为 8 卡5090,偏向于 GPU-server 的工作