主页

Diffusion Model Quantization: A Review

(共同一作 Under Review by IJCV2025 [CCF-A类期刊,CV领域顶刊])
Diffusion Model Quantization: A Review

一篇关于扩散模型量化(Diffusion Model Quantization)方向的全面综述,系统化梳理了从 U-Net 到 DiT 架构的底层量化困境,并从视觉伪影与去噪轨迹偏移双重视角开创性地剖析了量化误差,构建了该领域首个统一基准与开源平台(详情可点击上面的Arxiv标志查看论文,点击上面的Github标志访问项目主页)。

1. 概述

当前大型文本到图像(Text-to-Image)扩散模型虽在生成任务上取得了空前成功,但其庞大的算力与内存开销严重阻碍了在资源受限的边缘设备上的部署。**模型量化(Model Quantization)**已成为兼顾压缩与加速的核心技术。本篇综述通过全面汇总该领域的最新研究与前沿进展,系统填平了由于大模型快速更迭导致的理论盲区与度量标准碎片化的鸿沟。

SLDDM-TPG Model Architecture
图 1: 扩散模型量化工作的分类概述

2. 动机与解决的问题

  • 网络架构更替带来的新挑战:自 U-Net 演进到极具潜力的扩散 Transformer (DiT) 架构,不同网络特性的内部特征分布截然不同,粗暴套用传统视觉网络的量化策略极易导致精度崩溃。
  • 马尔可夫去噪引起误差级联:扩散生成的本质是多步迭代去噪,在单步中极其微小的量化截断误差会在漫长的长轨迹推理中被指数级放大(Error Accumulation),导致极其恶劣的图像退化。
  • 缺乏统一的测评基准:当前业界各类后训练量化 (PTQ) 及量化感知训练 (QAT) 方案层出不穷,但彼此的评估环境大相径庭,难以进行硬核的有效性确认与瓶颈对比。

3. 核心内容

针对上述挑战,本文构筑了完整的扩散量化研究全景图:

  • 全面分类法溯源 (Taxonomy):对最前沿的模型量化策略进行详尽分类和对比,深度探讨了这些方案背后的设计机制与数学原理。
  • 定性深度解析 (Qualitative Analysis):开创性地将量化引发的负面效应分别细化为视觉伪影验证(Visual Analysis)去噪轨迹偏移考察(Trajectory Examination),详细揭示了精度灾难是在哪些时间步和特征层发生变异的。
  • 定量公平评估 (Quantitative Benchmarking):基于业内公认的标准数据集建立公平的 Benchmark 平台,在相同的约束环境下严格运行各主流算法以提供具备指导意义的公允排名。

SLDDM-TPG Model Architecture
图 2: 扩散模型量化工作每个工作的highlight和支持的量化bitwidth

4. 创新性贡献

  1. 架构全覆盖:率先同时总结了服务于传统 U-Net 与现代 DiT 架构的扩散模型量化原理,以及它们各自对应的部署陷阱。
  2. 多维解析视角:突破性地不仅看重 FID、IS 分数等最终维度结果,更从微观的时间步“轨迹漂移”深入揭示了量化过程背后的失败机理。
  3. 推进行业开放协作:全面开源了该领域一整套成体系的文献大纲库、算法实现代码与统一基准运行结果,大幅降低了后来研究者的跟进壁垒。

SLDDM-TPG Model Architecture
图 3: 在 ImageNet 256×256 数据集上,使用 PTQ4DM [40]、Q-Diffusion、EDA-DM、QNCD、PTQD、D2-DPM、TFMQ-DM、EfficientDM 和 QuEST 对全精度 LDM-4 及其量化版本进行边缘检测结果的视觉比较

5. 总结

作为极具学术及工程指导意义的先锋综述,本文通过系统的分类脉络、深层定性机理解释与广泛的定量基准比对,给出了生成式大扩散模型平民化落地的清晰路线图。它不仅精准阐明了因量化导致生成失效的根源法则,更为后续攻克轻量化终端模型指明了可靠的突破策略。