阅读深度

Pixel Diffusion 速览:每篇一个「配方」+ 一句话

覆盖 2025-08 ~ 2026-08 · 面向没读过这些论文的读者 · 检索时间 2026-08-23

零基础读法:先把这条线从「词」走到「评测」

定义:图像生成模型的任务是,给定一段文字或类别,让模型输出一张新图。最主流的一类做法叫「扩散/流模型」:先从真实图逐步加噪声把它毁掉,再训练一个网络反过来逐步去噪,最后从纯噪声里一步步生成图片。

方法:这个反推过程有三种训练目标——预测噪声(ε-pred)、预测每步变化速度(v-pred)、或直接预测干净图(x-pred)。对应损失本质都是回归,也就是让网络预测值尽量接近真实目标。另一个方向是自回归(AR):把图片切成 token,像语言模型一样一个接一个预测。

模型:早期用 U-Net;后来换成 Transformer/ViT,把图切成 patch。为了省钱,很多人先用 VAE 把图像压成低维 latent 再扩散;本综述的主线是「像素扩散」——丢掉 VAE,直接在高分辨率像素空间里训练生成器。

算法:最需要记住的是三步——加噪、学去噪、采样。DDPM 一步步去噪;flow matching 把去噪看成「沿直线从噪声流向图片」;consistency 模型进一步把多步压成少步/一步。自回归路线则用因果 Transformer 逐 token 采样。

评测:生成质量常用 FID(越接近真实分布越低越好)和 Inception Score(越高越好);文字一致性看 GenEval、DPG-Bench、CLIP score;此外还要看分辨率、采样步数、训练/推理速度。

带着这套框架再看下面「脉络」档:每篇只需记住它改了上面哪一个环节,以及为什么重要。

0. 先看懂「配方」记法

记号意思
flow(A + noise)flow matching / rectified flow,在 A 上从噪声流向数据
diffuse(A + noise)DDPM 式去噪扩散,在 A 上逐步去噪
meanflow(A + noise)MeanFlow 式一步流
ar(A)自回归(next-token)
patchpatchify 后的原始像素
vae(patch)VAE 压缩后的潜空间
-> pred + loss网络预测 pred($\varepsilon$ / v / x / consistency),用 loss 做损失
$\varepsilon$-loss / v-loss / x-loss / consistency-loss损失类型:噪声 MSE / 速度 MSE / 干净图 MSE / 一致性损失
X_sharedX 由「理解 + 生成」共享
X_und + X_gen理解与生成各自独立(两套 X)
X (Y_und + Y_gen)X 共享,其内部 Y 拆成 und / gen 两份
扩散/流模型 = 「逐步加噪声,再学一个网络把噪声往回推」。老路线为省钱把「推」搬进 VAE 潜空间;这波 pixel diffusion 的核心就是把「推」直接搬回原始像素,省掉 VAE。

1. 主线:谁、克服了什么

  1. 「像素太贵,必须潜空间」→ 被 simple diffusion / 噪声调度 / RIN / HDiT 拆掉:端到端像素也能到 $1024^2$。
  2. 「必须预测噪声/速度」→ 被 JiT 拆掉:直接预测干净图(x-pred)就行。
  3. 「必须多步采样」→ 被 MeanFlow / pMF 拆掉:一步生成。
  4. 「必须有 VAE 才有表示」→ 被 EPG 拆掉:自监督预训练替代 VAE。
  5. 「像素丢高频 / 一个 patch 粒度难兼顾全局+局部」→ 被 DeCo / DiP / PixelDiT / HyperDiT 逐个补。
  6. 「生成与理解割裂」→ 被 HiDream-O1 / NextFlow / UniFlow 往统一模型推。
  7. 「视觉生成缺缩放律」→ 被 Abra 补上。

更宏观地看,是三个「轴」在同时收敛:

轴从到代表
空间latent(VAE)pixel(无 VAE)JiT / PixelDiT / L2P / PiD
步数多步少步 / 一步MeanFlow / pMF / CrossFlow
范式diffusion / flowautoregressiveD-AR / PRA / NextFlow / Transfusion

三条轴的交点就是同一个目标:一个 Transformer、像素 token、理解+生成统一(HiDream-O1、NextFlow)。

2. 逐篇配方 + 一句话

2.1 历史铺垫(窗口前,必要背景)

扩散最早直接在像素上「逐步加噪再学去噪」,但每步跑全分辨率太贵,于是转向 VAE 潜空间(LDM / Stable Diffusion)成为主流——代价是有损压缩、非端到端,给后来「回归像素」埋下伏笔。与此同时,score matching(SDE)→ flow matching → rectified flow → stochastic interpolants → SiT 这一支「把生成当速度场」的理论在 2022-2024 年成熟,是下面所有 `flow(...)` 记号的底座。

DDPM(2006.11239)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss
问题 GAN 训练不稳、易模式崩塌;方法 把生成改成「逐步加噪→逐步去噪」,网络直接预测噪声;核心 把难的「一步生成」拆成很多步简单的「去噪」;后续 DDIM / EDM 指出 1000 步马尔可夫采样太慢、随机游走低效,改成少步确定性与更优噪声调度——扩散线没被放弃,而是被 score SDE / flow matching 继承。

LDM / Stable Diffusion(2112.10752)
diffuse(vae(patch) + noise) -> $\varepsilon$-pred + $\varepsilon$-loss
问题 像素空间去噪每步都跑全分辨率、太贵;方法 先用 VAE 压到潜空间再扩散;核心 VAE 有损、且「重建」与「生成」目标错位——正是后来「回归像素」要解决的痛点;后续像素 flow / Tuna-R 把「去 VAE、回归像素」做成主线,latent diffusion 作为保守派仍保留。

DiT(2212.09748)
diffuse(vae(patch) + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(U-Net → ViT)
问题 U-Net 难随参数规模扩展;方法 用 ViT 替换 U-Net 做扩散骨干;核心 这是后来所有 pDiT 的架构底座;后续 U-ViT / PixelU 指出纯 ViT 易丢细节,补 U 形跳跃连接——DiT 本身没被放弃,被继承为 pDiT 的默认骨干。

U-ViT(2209.12152)
diffuse(vae(patch) + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(ViT + 长跳跃连接)
问题 纯 ViT 难保留细节;方法 加长跳跃连接的 U 形 ViT;核心 这个 U 形思路后来被 PixelU 捡回。

simple diffusion(2301.11093)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss + 分辨率相关噪声调度
问题 「像素扩散上不了高分辨率」的共识;方法 调对噪声调度直接端到端像素生成;核心 第一个有力挑战「必须潜空间」。

On the Importance of Noise Scheduling(2301.10972)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss + 自适应噪声调度
问题 噪声调度不对导致像素扩散质量差;方法 随分辨率自适应调调度;核心 配 RIN 做到 $1024^2$。

RIN(Recurrent Interface Networks)(2212.11972)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(循环接口网络)
问题 高分辨率下注意力算力爆表;方法 用少量「接口 token」循环更新;核心 省算力做大分辨率。

Hourglass DiT(2401.11605)
diffuse(patch + noise) -> v-pred + v-loss(沙漏式多尺度)
问题 高分辨率 token 太多;方法 先压缩后展开的沙漏结构;核心 多尺度做高分辨率像素合成。

Simpler Diffusion (SiD2)(2410.19324)
diffuse(patch + noise) -> v-pred + sigmoid loss(噪声调度)
问题 像素扩散质量长期不如潜空间;方法 sigmoid 损失 + 分辨率相关调度;核心 $512^2$ 达 1.5 FID,打平潜空间。

Score-Based Generative Modeling through SDEs(2011.13456)
diffuse(A + noise) -> score-pred + score-loss(SDE 统一)
问题 扩散与 score matching 各自为战;方法 用随机微分方程(SDE)统一 DDPM 与 score matching;核心 score-based 生成的理论统一,是 `diffuse(...)` 记号的源头;后续 flow matching / stochastic interpolants 指出 SDE 采样路径绕、步数多,改走直线 ODE——理论被统一继承而非放弃。

Flow Matching(2210.02747)
flow(A + noise) -> v-pred + flow-loss(条件概率路径)
问题 连续流训练难、扩散要复杂调度;方法 在噪声-数据点对间定义简单条件概率路径、直接回归速度场 v;核心 把生成变成「学速度场」,是本综述所有 `flow(...)` 记号的范式源头;后续 Rectified Flow 指出 naive 条件路径会交叉、采样绕,用 reflow 拉直——这条线被继承为 rectified flow。

Rectified Flow(2209.03003)
flow(A + noise) -> v-pred + rectified flow-loss(直线路径 + reflow)
问题 流路径弯曲、采样步数多;方法 用直线路径连接噪声与数据、反复「拉直」(reflow);核心 直线流让采样更少步、更稳;后续 SD3 证明 reflow 不是上规模的必需项,直接 scaling rectified flow 即可,这条线被继承为 rectified flow + MMDiT。

Stochastic Interpolants(2303.08797)
flow(A + noise) -> v-pred + interpolant-loss(统一 SDE/ODE)
问题 扩散与流是两套形式、不好统一;方法 用随机插值(stochastic interpolant)统一 SDE/ODE 视角、噪声与路径可自由选;核心 扩散与流的统一理论框架(SiT 的理论底座)。

EDM(Elucidating the Design Space)(2206.00364)
diffuse(A + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(设计空间/调度)
问题 扩散超参繁杂、难调;方法 系统厘清设计空间、给出最优噪声调度与参数化;核心 噪声调度的「圣经」,简单扩散/RIN/SiD2 都从它出发。

Consistency Models(2303.01469)
consistency(A + noise) -> consistency-pred + consistency-loss
问题 多步采样慢;方法 学「任意噪声直接映射到干净图」的一致性映射、可一步生成;核心 一致性损失 = 本综述 EPG/CrossFlow 里 consistency-loss 的源头;后续 LCM / EPG 指出初版训练不稳、少步质量与扩散仍有差距,改为 latent consistency 或像素空间两阶段训练——一致性路线被继承而非放弃。

SiT(Scalable Interpolant Transformers)(2401.08740)
flow(A + noise) -> v-pred + v-loss(interpolant Transformer)
问题 DiT 是扩散专用、没系统探索流;方法 把 DiT 放进插值框架、系统对比流 vs 扩散;核心 流的 DiT 版本,pDiT 的直接前身。

Imagen(Cascaded Diffusion)(2205.11487)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(级联 $64^2$→$1024^2$)
问题 文生图想要高保真;方法 在像素空间做级联超分($64^2$→$256^2$→$1024^2$)+ 大语言模型编码文本;核心 早期像素空间文生图(级联),证明像素扩散可行。

SD3(Scaling Rectified Flow Transformers)(2403.03206)
flow(patch + noise) -> v-pred + flow-loss(MMDiT + rectified flow)
问题 rectified flow 能否上规模;方法 MMDiT(文本/图像双流)+ rectified flow 做大文生图;核心 rectified flow 的规模化验证,pixel flow 的重要前身。

2.2 像素空间 flow 时代(2025 年中)

2025 年中,flow matching 取代 DDPM 式去噪成为新范式(一条直线从噪声流到数据、更好训)。有人开始直接在像素空间做 flow,证明不靠 VAE 也能端到端生成。

PixelFlow(2504.07963)
flow(patch + noise) -> v-pred + v-loss(级联多分辨率)
问题 像素扩散又慢又贵;方法 用 rectified flow + 从低到高的级联;核心 端到端、无需 VAE。

PixNerd(2507.23268)
flow(patch + noise) -> v-pred + v-loss(NeRF 隐式场头)
问题 DiT 线性投影显存大、慢;方法 把线性投影换成隐式神经场(NeRF 头);核心 省显存又更快。

2.3 奠基催化(2025-10 ~ 2026-01)

2025 末到 2026 初的三个开关一起引爆了热潮:JiT 用 x-prediction 拆掉「必须预测噪声/速度」,MeanFlow 拆掉「必须多步」,EPG 拆掉「必须有 VAE」。

MeanFlow(2505.13447)
meanflow(patch + noise) -> v-pred + v-loss(一步)
问题 多步采样慢;方法 用「平均速度场」把多步压成一步;核心 一步生成建模框架。

JiT(Back to Basics)(2511.13720)
flow(patch + noise) -> x-pred + v-loss
问题 高维像素空间预测噪声/速度会崩;方法 让网络直接预测干净图 x(x-pred),损失用 v-loss(把 x̂ 换算成 v̂=(x̂−z_t)/(1−t) 再回归);核心 干净图在低维流形、噪声图在高维全空间,所以 x-pred 让普通 ViT + 大 patch 训得动——整波的关键开关。

EPG(There is No VAE)(2510.12586)
flow(patch + noise) -> x-pred + consistency-loss(SSL 预训练 + 像素空间一致性训练)
问题 没 VAE 就学不出好表示;方法 先自监督预训练学语义,再端到端在原始高分辨率像素上训一致性模型(不用预训练 VAE / 扩散);核心 用 SSL 的「两阶段」替代 VAE 的「压缩」,是首个直接在像素上训 consistency model 的路线。

pMF(Pixel Mean Flow)(2601.22158)
meanflow(patch + noise) -> x-pred + v-loss(+ 感知损失)
问题 一步 + 无潜空间难做好;方法 把 JiT 的 x-pred 与 MeanFlow 的一步结合,再叠加感知损失;核心 一步无潜空间生成($256^2$ 2.22 FID)。

CrossFlow(2606.19970)
flow(patch ⊕ vae(patch) + noise) -> consistency + consistency-loss
问题 一步生成只限于单一空间;方法 跨潜/像素空间的一致性约束;核心 一步生成同时贯通两个空间。

One Step Diffusion via Shortcut Models(2410.12557)
flow(A + noise) -> x-pred + shortcut-loss(自洽一步)
问题 一步生成通常要蒸馏、多阶段;方法 单网络单阶段学「任意时刻直接跳干净图」的 shortcut;核心 一步生成无需蒸馏,MeanFlow/pMF 一步线的平行工作。

2.4 pDiT 架构主线(2025-11 ~ 2026-07)

JiT 之后,大家开始为像素空间专门设计架构。核心矛盾是 granularity dilemma——一个 patch 粒度很难同时顾好全局布局和局部纹理,于是出现双层、U 形、超连接、语义锚点等各路解法。

PixelDiT(NVIDIA, CVPR 2026 Best Paper Finalist)(2511.20645)
flow(patch + noise) -> v-pred + v-loss(双层:patch DiT + pixel DiT)
问题 单 patch 粒度难兼顾全局布局与局部纹理;方法 双层(大 patch DiT 管布局 + 小 patch DiT 补纹理);核心 无 VAE 端到端做到 $1024^2$ 文生图。

MiniT2I(何恺明团队,2026-06,MM-JiT)(博客 / 代码)
flow(patch + text) -> x-pred + v-loss(MM-JiT = JiT + 轻量文本适配器)
问题 主流文生图依赖大模型 + 一堆复杂组件;方法 把 JiT 的极简主义搬到文生图,只加轻量文本适配器;核心 无 VAE/AdaLN/辅助损失/私有数据,258M 参数做到 0.87 GenEval。

PRXPixel(Photoroom)(HF)
flow(patch + noise) -> v-pred + v-loss(Qwen3-VL 文本编码,~7B)
问题 缺开源无 VAE 文生图;方法 直接对 RGB 去噪 + Qwen3-VL 文本编码;核心 开源像素空间文生图。

DiP(Taming Diffusion in Pixel Space)(2511.18822)
flow(patch + noise) -> v-pred + v-loss(全局 DiT + 轻量 detail 头)
问题 像素空间「质量 vs 算力」的权衡;方法 拆成「全局结构 + 局部细节」两步;核心 大 patch 管全局、轻量头补局部。

PixelGen(2602.02493)
flow(patch + noise) -> v-pred + v-loss + lpips($\hat{x}$, $x$) + $1-\cos(f_{DINO}(\hat{x}), f_{DINO}(x))$ + repa
问题 像素扩散主观质量不如潜空间;方法 在 flow-matching 损失外加两种感知损失:LPIPS 按 VGG 各层加权 $L_2$ 管局部纹理,patch 级 DINO 特征余弦相似度 $1-\cos(f_{DINO}(\hat{x}), f_{DINO}(x))$ 管全局语义,再叠加 REPA 表示对齐;核心 ImageNet-256 无 CFG、80 epoch FID 5.11(对比 REPA latent baseline 800 epoch 5.90),GenEval 0.79。

HyperDiT(2605.15741)
flow(patch + noise) -> v-pred + v-loss(跨尺度超连接 + register)
问题 granularity dilemma(一个粒度难兼顾全局/局部);方法 跨尺度超连接 + 用 register 接 VFM 语义;核心 借语义引导细粒度生成。

AsymFlow(2605.12964)
flow(patch + noise) -> v-pred(rank-asymmetric:噪声低秩 + 数据全维)
问题 像素空间 flow 难训、且想把 latent 模型变像素模型;方法 rank-asymmetric:噪声预测限在低秩子空间、数据预测保持全维,并把低秩像素子空间对齐到 latent 空间来微调;核心 噪声低秩、数据全维的不对称参数化,$256^2$ 1.57 FID。

PixelU(2606.27760)
flow(patch + noise) -> v-pred + v-loss(U 形 Transformer)
问题 低频语义与高频信号难在一个网络里同时建模;方法 U 形分层结构;核心 $256^2$ 达 1.63 FID。

AnchorDiT(解读)
flow(patch + noise) -> v-pred + v-loss(语义锚点引导)
问题 单 patch 粒度难兼顾全局语义与局部细节(granularity dilemma);方法 大尺度分支提炼多层语义锚点、小尺度分支保留细节,Anchor Connector 做几何对齐让细粒度 token 持续查询稠密语义;核心 跨尺度语义锚点引导。

2.5 频率分支(2025-11 ~ 2026-08)

像素空间最大的痛点是高频细节容易丢。一条支线把「低频语义」和「高频纹理」显式拆开,各交给不同模块 / 路径处理。

DeCo(2511.19365)
flow(patch + noise) -> v-pred + 频率感知 v-loss(JPEG 量化表逐频加权)+ 轻量像素解码器
问题 像素扩散丢高频细节;方法 把归一化后 JPEG 量化表权重的倒数当逐频率权重、加进 flow-matching 损失,DiT 只出低频语义、轻量 pixel decoder 据低频语义补高频;核心 低频语义与高频纹理各管各的频段,ImageNet FID $256^2$ 1.62、$512^2$ 2.22。

FrequencyBooster(2605.17759)
flow(patch + noise) -> v-pred + v-loss(全频段建模)
问题 像素扩散高频细节不保真;方法 DiT 主干 + 大容量 FB-Decoder 专门提取高频细节与低频语义,再 Fusion 融合;核心 高频解码器与低频语义分离建模。

Spectral Forcing(2606.15236)
flow(patch + noise) -> v-pred + v-loss(DCT 低通掩码)
问题 去噪器在高频噪声上浪费容量;方法 输入前用 DCT 低通掩码「给去噪器看信号、藏噪声」;核心 参数免费还更省容量。

FREPix(2605.06421)
flow(patch + noise) -> v-pred + 频率感知 loss + repa + lpips(低/高频分 schedule)
问题 一个 flow 难同时搬低频与高频;方法 把状态拆成低频/高频两个子状态,各配独立 schedule $g_l(t)$、$g_h(t)$,分解后的网络分别预测两个分量,最终目标除频率感知 loss 外还加 REPA 与 LPIPS;核心 频率异构的 flow matching。

Energy-Guided Flow Matching(2608.05811)
flow(patch + noise) -> v-pred + v-loss(heat-kernel 滤波的移动终点)
问题 固定终点的 flow 不够灵活;方法 把固定干净终点换成 heat-kernel 滤波后的移动终点,按每张图频谱能量决定何时释放高频信号;核心 终点自适应,0.85 GenEval。

RaPD(Resolution-Agnostic Pixel Diffusion)(2605.15908)
flow(nif(patch) + noise) -> v-pred + v-loss(VFM 语义引导 + 密度感知时刻偏移)
问题 像素扩散绑定固定分辨率;方法 在连续神经图像场(NIF)latent 上扩散:Semantic Representation Guidance 注入 VFM 语义做 generation-aware latent 学习,Latent-Density-Aware Timestep Shift 按 latent 密度调 schedule,Coordinate-Queried Attention Renderer 按坐标渲染;核心 分辨率无关生成。

2.6 训练技巧与机理

除了改架构,还有人从训练本身下手:表示对齐、register、自引导、缩放律,各自补一个像素扩散的短板。

PixelREPA(KAIST)(2603.14366)
flow(patch + noise) -> x-pred + v-loss + cos(mta(h_t, mask), dino(x).detach())
问题 原版 REPA 的 patch 级 MLP 直接回归会撞上「像素空间自由度高、DINO 目标压缩低」的信息不对称,导致 feature hacking、多样性崩;方法 把 MLP 换成带随机 token mask 的浅层 Transformer adapter(MTA):先对中间表示 $h_t$ 做上下文聚合,再和冻结 DINO 对干净图 $x$ 的 patch 特征做余弦相似度;核心 用 mask 把像素侧自由度压下来、逼 adapter 做 contextual prediction,而不是逐 token 走捷径;JiT-B/16 ImageNet-256 FID 3.66→3.17、IS 275.1→284.6,收敛 >2×。

Registers Matter for pDiT(2605.16147)
flow(patch + noise) -> v-pred + v-loss + Register Guidance [$\hat{v}_t = v(x_t,t,R) + w_{rg}(v(x_t,t,R)-v(x_t,t,0))$]
问题 DiT 里高范数 token 的作用不清;方法 证明这些高范数 token 就是 register、对像素 DiT 生成质量关键;推理时用「有 register 的速度减去无 register 的速度」做引导:$\hat{v}_t = v(x_t,t,R) + w_{rg}(v(x_t,t,R)-v(x_t,t,0))$;核心 register 是像素 DiT 的隐性语义载体。

A Frozen Pixel-Space Diffusion Model Can Guide Itself(2607.29122)
flow(patch + noise) -> v-pred + v-loss(冻结自引导:中间 vs 最终预测差作引导)
问题 提升质量通常要重训;方法 冻结主干,只训 adapter,用「中间层预测与最终预测的差」作为自引导信号;核心 无需重新训练主干即可提升。

Abra(Scaling Diffusion Image Training)(2608.17286)
flow(...) -> v-pred + v-loss(缩放律)
问题 视觉生成缺 compute-optimal scaling law;方法 跨三个数量级算力拟合缩放律;核心 ~200 image tokens/参数(Chinchilla 10 倍),应多喂数据少堆模型。

REPA(Representation Alignment for Generation)(2410.06940)
flow(A + noise) -> v-pred + cos(h_phi(h_t), dino(x).detach())
问题 DiT 训练难、收敛慢;方法 把去噪网络中间表示 $h_t$ 用可训练 MLP $h_\phi$ 投影,再与冻结 DINO 对干净图 $x$ 的 patch 特征做余弦相似度最大化;论文横评 MAE、DINO、MoCov3、CLIP、SigLIP、DINOv2 做教师,DINOv2 系列的 FID 最好,因此选它做对齐目标;核心 表示对齐让 DiT 训练快 17.5×、质量更好——PixelREPA 的源头。

2.7 像素解码器(VAE 降级 / 删除)

一条更保守的路线:不删整个 VAE,只把最后「latent → 像素」的解码器换成像素扩散,既保留 latent 的高效又补回细节。

PiD(NVIDIA, Pixel Diffusion Decoder)(2605.23902)
flow(vae(patch) + noise) -> v-pred + v-loss(latent → 像素解码)
问题 VAE 解码器高分辨率吃内存、丢细节;方法 把 latent→像素解码也换成条件像素扩散;核心 统一解码+超分、支持 4K(保守派:保留 latent)。

L2P(Unlocking Latent Potential for Pixel Generation)(2605.12013)
flow(patch + noise) -> v-pred + v-loss(冻结 LDM 中间层、只训浅层)
问题 VAE 是像素生成的内存/质量瓶颈;方法 删掉 VAE,冻结已训 latent 模型中间层、只训浅层做 latent→像素;核心 解锁原生 4K/8K(激进派)。

LTX-2.5(Lightricks)(dev.to)
flow(vae(patch) + noise) -> v-pred + 像素空间 loss(视频解码)
问题 视频 latent 解码丢细节;方法 视频解码器也做成扩散、用像素空间损失;核心 补回 latent 丢的细节。

RAE(Diffusion Transformers with Representation Autoencoders)(2510.11690)
flow(rae(patch) + noise) -> v-pred + 重建 loss(表示自编码器:冻结 DINO/SigLIP/MAE + 训 decoder)
问题 VAE 是否不可替代;方法 冻结表示编码器(DINO / SigLIP / MAE)并训 decoder 组成 RAE:阶段一先做重建,阶段二再在该 latent 上训扩散;核心 表示自编码器比 VAE 更简更强,是本综述「去 VAE」的中坚。

Latent Diffusion Model without VAE(2510.15301)
flow(dinov3(patch) + noise) -> v-pred + 重建 loss(无 VAE latent)
问题 VAE 是有损瓶颈;方法 用冻结的 DINOv3 自监督特征直接当 latent,再加轻量残差编码器补细节,然后做 latent diffusion;核心 「latent 但无 VAE」的中间路线,衔接 EPG/Tuna-R。

MAETok(Masked Autoencoders Are Effective Tokenizers)(2502.03444)
masked-ae(patch) -> 重建 + 扩散(MAE tokenizer)
问题 VAE 潜空间结构差、影响扩散质量;方法 用掩码自编码器(MAE)学语义更丰富的潜空间;核心 MAE tokenizer 提升扩散质量与训练速度。

2.8 自回归(AR)路线:离散 token → 连续 token → 像素 token

与扩散并行的是自回归(像 LLM 一样逐 token 生成)。早期用离散 token(VQ),后来连续 token、再到与扩散合流,两条路线在「像素 token」上汇合。

VQGAN(Taming Transformers)(2012.09841)
ar(vq(patch)) -> ce(h_t, x_{t+1}) [h_t = 位置 t 的 codebook logits;x_{t+1} = 下一真实 VQ code index](VQ 离散化)
问题 图像生成缺好用的离散 token;方法 VQ-VAE 学离散 codebook + transformer 建模;核心 离散视觉 token 的源头,LlamaGen/VAR 的底座;后续 LlamaGen/VAR 继承离散 token,但 MAR 指出量化损失、表达受限,改走连续 token——「离散 AR」这条线被 MAR 部分放弃。

LlamaGen(2406.06525)
ar(vq(patch)) -> ce(h_t, x_{t+1}) [h_t = codebook logits;x_{t+1} = 下一真实 VQ code index]
问题 AR 路线能不能做出 SOTA 图像生成(当时被扩散压着);方法 把 LLM 的 vanilla next-token prediction 直接搬到 VQ token 上;核心 证明「普通 AR 也能打」,拉开视觉 AR 的序幕;后续 VAR 指出光栅序违反图像层级、生成慢,改 next-scale,MAR 又放弃 VQ 走连续 token。

VAR(2404.02905)
ar(vq 多尺度) -> ce(h_r, x_r) [h_r = scale r 的 codebook logits;x_r = scale r 的真实 token map]
问题 逐 token(光栅序)生成又慢又违反图像的层级结构;方法 多尺度 VQ + 从粗到细逐尺度预测;核心 next-scale 取代 next-token;后续 MAR / Fluid 指出多尺度离散仍量化有损、scale 受限,转连续 token——next-scale 思想被 Fractal 继承,但离散化被弃。

MAR(2406.11838)
ar(mask patch) -> mse(去噪头输出, 扩散目标)(去噪 MSE 作逐 token 似然代理)
问题 VQ 离散化有量化损失、表达受限;方法 丢掉 VQ,用掩码自回归 + 去噪 MSE(diffusion-loss)作为逐 token 似然代理来建模连续 token;核心 AR 不一定要离散 token。

Fluid(2410.13863)
ar(patch 连续 token) -> flow-loss(随机序)
问题 离散 token + 光栅序不是最优;方法 10.5B 连续 token + 随机序自回归;核心 连续 + 随机序比离散 + 光栅序更好,zero-shot MS-COCO FID 6.16、GenEval 0.69。

LongCat-Next(2603.27538)
ar(discrete text+image+audio) -> ce(h_t, x_{t+1}) [h_t = 统一离散词表 logits;x_{t+1} = 下一 token id] [dNaViT]
问题 各模态各自一套 tokenizer / model;方法 把所有模态词元化成同一离散 token 空间,纯 NTP 一个模型搞定;核心 离散原生多模态(MoE A3B、2T tokens)。

Farmer(2510.23588)
ar(nf(patch)) -> 连续 latent 序列分布建模(可逆 normalizing flow + AR)
问题 离散 token 有量化损失;方法 用可逆自回归 flow 把图像变换成 latent 序列,再由 AR 建模其分布;核心 normalizing flow + AR,不是 flow matching,无量化损失的像素自回归。

Fractal Generative Models(2502.17437)
ar(patch 多粒度) -> 分形 ce(h_l, x_l) [h_l = 层级 l 的下一 token logits;x_l = 该层真实 token / pixel index]
问题 AR 逐像素/逐 token 低效、生成慢;方法 用「分形」把生成模块化成多粒度自回归、可并行动态规划;核心 像素级自回归的分形扩展(何恺明组)。

D-AR(Diffusion via Autoregressive)(ICLR 2026)
ar(扩散 token) -> ce(h_t, x_{t+1}) [h_t = codebook logits;x_{t+1} = 下一扩散 token 的离散 index]
问题 扩散与 AR 是两套范式;方法 把扩散过程重写成标准 next-token 预测;核心 普通 LLM 解码器就能生成图像。

NextStep-1(ICLR 2026)
ar(text离散 + image连续) -> ce(h_text, x_next) + mse(v_hat, v_target) [h_text = LM head logits;x_next = 下一文本 token id;v_hat = flow head 预测速度;v_target = 干净 patch 与噪声 patch 的速度差]
问题 连续 token 自回归难上规模;方法 14B 连续 token 自回归;核心 大规模连续 token 文生图。

PRA(Parallel Rollout Approximation)(2606.27978)
ar(patch 连续 token) -> mse(v_hat, v_target) + 并行 rollout [h = prefix hidden state;v_hat = flow head(h, x_i^t, t);v_target = 目标 patch 的直线速度]
问题 像素自回归质量差;方法 并行 rollout 近似;核心 提升像素自回归质量。

MAR-GRPO(2604.06966)
ar(mask patch) -> 冻结扩散头 + GRPO [multi-trajectory expectation + consistency-aware token 筛选]
问题 掩码自回归 + 扩散头训练不稳定;方法 冻结扩散头、只用 GRPO 优化 AR Transformer;multi-trajectory expectation 对多条扩散轨迹取平均降扩散噪声梯度,consistency-aware token selection 筛掉与最终内容不一致的 AR token;核心 稳定训练 + 降扩散头噪声梯度。

NextFlow(2601.02204)
transformer_shared (codebook_sem + codebook_pix) -> ce(h_t, x_{t+1}) [h_t = 双 codebook 拼接后的 logits;x_{t+1} = 下一语义/像素 token id]
问题 语义与像素难统一建模;方法 双 codebook:语义 codebook 管物体/内容,像素 codebook 管纹理/细节;核心 6T 图文 token 统一自回归。

2.9 统一多模态 / 视觉基础模型

这部分已拆成独立深读:统一多模态模型速览。那里逐篇读原文(Tuna 家族的问题/方法/效果 + 引用网络),并改用更适合该领域的配方记法(视觉表示 × 目标 × 结构)。

2.10 应用扩展(3D / 几何 / 医疗 / 视频)

像素扩散的高保真特性,在 3D、几何、医疗这类「每个像素 / 体素都重要」的场景最有价值。

PointDiT(2607.02515)
flow(point-map patch + noise) -> x-pred + v-loss(DINOv3 条件)
问题 单图 3D 重建常用复杂混合架构;方法 极简 ViT 直接在 3D point map patch 上扩散,DINOv3 图像 token 做条件,x-prediction 预测干净点图;核心 像素空间扩散做几何,简单且对模糊区鲁棒。

PixGS(Semantic Scholar)
flow(patch + noise) -> v-pred + v-loss(→ 3D Gaussian Splat)
问题 3D 生成靠 latent 有多阶段误差;方法 像素扩散直接生成 3D 高斯;核心 绕过有损 latent。

PixWorld(2607.05373)
flow(patch + noise) -> v-pred + v-loss(→ 3DGS 重建+生成)
问题 3D 重建与生成是两套范式;方法 多视图拆成 clean/noisy——clean 驱动重建、noisy 被生成,都经多视图可微渲染监督 pixel-aligned 3D Gaussian;核心 一个模型统一重建+生成,无 VAE/RAE。

Rays as Pixels(2604.09429)
flow(vae(patch) + noise) -> v-pred + v-loss(→ 视频+相机轨迹)
问题 视频与相机轨迹分开建模;方法 把相机光线打包进 3 通道「raxel」;核心 视频 VAE 直接当相机编码器。

PixTex(DOI)
flow(patch + noise) -> v-pred + v-loss(→ 3D 纹理)
问题 latent 压缩损害细节、破坏多视图一致性;方法 像素空间多视图 inpainting 扩散 + 粗到细,联合补不可见区域;核心 无损耗几何引导 + 像素级多视图一致。

MedSyn(见 综述)
diffuse(patch + noise) -> $\varepsilon$-pred + $\varepsilon$-loss(→ 3D CT)
问题 医疗体数据生成保真难;方法 文字(临床报告)引导 + 解剖感知;核心 高保真 3D 肺部 CT 生成(医疗应用早期代表)。

Beyond Pixels(2608.10744)
flow(vae(patch) + noise) -> v-pred + v-loss(→ 4D 世界)
问题 视频模型学到的空间线索没被利用;方法 从视频 latent 直接生成动态 4D 世界,仅 1K 条数据打通统一接口;核心 视频→4D 的统一接口。

3. 共识与分歧(速记版)

共识:

  1. x-prediction 是像素空间高维训练的关键(JiT/pMF 后成为共识,并有维度理论背书)。
  2. VAE 不免费:有损、非端到端、高分辨率吃内存,去掉或降级有真实收益。
  3. 感知损失 / 频率解耦是大杠杆。
  4. 全局-局部分解架构(大 patch 管布局 + 小 patch 补细节)是标配。
  5. 像素 token 是统一多模态的方向。

分歧 / 难点:

  1. 删 VAE(PixelDiT/pMF/HiDream)vs 保 latent(PiD/LTX-2.5)——激进派 vs 保守派。
  2. granularity dilemma:低频语义与高频纹理在高维里互相拉扯,尚未统一解决。
  3. 高分辨率算力:端到端 4K 仍贵。
  4. 架构未收敛:U 形/双层/超连接/频率解耦并存,FID 差距极小。
  5. 扩散 vs 自回归在像素 token 上的终局未定。

说明:本综述经交叉引用各论文参考文献列表补齐了 flow/扩散地基(score SDE、flow matching、rectified flow、stochastic interpolants、EDM、consistency、SiT、Imagen、SD3、VQGAN)与若干被引但遗漏的工作(REPA、RAE、LDM-without-VAE、MAETok、shortcut models、Fractal、JetFormer)。MedSyn、NEO-unify、LTX-2.5、AnchorDiT 等部分工作仅有综述引用或新闻页,未逐一取得稳定 arXiv 编号,以可访问链接为准。Abra 摘要未明说像素/潜空间,正文需进一步核对,此处按其自述的「text-to-image flow-matching transformers」描述。