Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective
(Under Review by AAAI 2027 [CCF-A])
给定一张源图像与一句编辑指令,EditMod 直接从编码后的源图像状态出发,把编辑建模为”源到目标”的残差变化,无需反演、无需测试时优化、也无需用户提供 mask,即可实现免训练(training-free)的高保真文本引导图像编辑(详情可点击上面的 Arxiv 标志查看论文)。
1. 概述
本文提出了 EditMod,一个基于”以源为中心”(source-centric)视角的视觉自回归(VAR)图像编辑方法。与现有方法把编辑视为”目标条件再生成 + 源信息约束”不同,EditMod 直接保留尺度对齐的源表示,只建模用户请求的语义变化 。在共享自回归上下文下,它比较源条件与目标条件的下一尺度预测,将两者的差异作为尺度级编辑方向,并以残差更新的方式作用到源 token 上。
图 1: EditMod 在多种编辑任务上的效果
2. 动机与解决的问题
- 现有的免训练 VAR 图像编辑方法普遍沿用”以生成为中心”(generation-centric)的范式,存在明显局限:
- 目标条件再生成:将编辑建模为目标条件再生成、再用源信息约束,未能充分利用 VAR 提供的多尺度源表示。
- 额外计算与干预:往往依赖反演(inversion)、测试时优化(test-time optimization)、注意力控制(attention control)或用户提供的 mask,带来额外开销。
- 保真度瓶颈:源信息仅作为约束,模型需重建布局、身份、局部细节等共享内容,保真负担重、编辑保真度受限。
3. 核心方法
EditMod 采用尺度感知(scale-aware)策略,适配 VAR 从粗到细的生成动态:
图 2: EditMod 的整体框架
粗尺度(Coarse Scales)
预填充源 token,锚定原始的全局结构与空间布局。
中间尺度(Intermediate Scales)
在共享自回归上下文下,计算目标条件与源条件预测的差异,作为尺度级编辑方向,并以残差更新方式作用到尺度匹配的源表示上:
- 编辑方向:
细尺度(Fine Scales)
从编辑后的上下文出发进行目标条件自回归采样,合成与请求一致的局部细节。
4. 创新性贡献
- 全新编辑范式:首次围绕编码源图像状态 重新表述 VAR 编辑,把语义变化建模为”源到目标”残差 ,而非仅将源信息作为目标条件状态的约束。
- 免 mask、免训练的编辑器:EditMod 无需反演、无需测试时优化、无需 mask,在粗尺度预填充源 token、中间尺度施加共享上下文预测位移、细尺度采样目标一致细节。
- 领先的性能与效率:在保持强文本对齐的同时实现领先的源图像保真度,单张 A100 GPU 上 1.57 秒完成 1K 图像的端到端编辑,比 AREdit 推理时间降低 47.7%、LPIPS 降低 15.1%。
5. 总结
EditMod 通过”以源为中心”的视角,将 VAR 图像编辑从”目标条件再生成”转向”源状态上的残差建模”,在保真度、文本对齐与推理效率之间取得了良好的平衡,为视觉自回归模型在图像编辑任务上的应用提供了新范式。