论文速览

每篇一个「配方」(伪代码 + 损失)+ 一句话总结,按主题归类,面向初学者。

生成模型

Pixel Diffusion 速览(2025-08 ~ 2026-08)

像素空间扩散 / flow 的一整波进展:谁、克服了什么,共识与分歧,72 篇论文。

多模态

统一多模态模型速览(Unified Multimodal Models)

理解 + 生成放进同一个模型:Tuna 家族深读 + 引用网络,18 篇。

NLP / 句法

Grammar Induction / Unsupervised Parsing 速览(2010 ~ 2026)

无监督句法分析三代演进:经典/谱 → 神经 → LLM 时代,81 篇论文。

长上下文 / 架构

长上下文(Long Context)速览(2020 ~ 2026)

稀疏/硬件高效注意力、attention sink、KV 驱逐与压缩、位置外推、长上下文训练与 benchmark,65 篇。

架构 / 效率

线性注意力速览(Linear Attention,2020 ~ 2026)

把历史压进定长 state:kernel 线性 / SSM / delta 规则 / TTT / Titans,及 Qwen3-Next、Kimi K3 混合旗舰 + RWKV / fla 算法谱系,59 篇。

架构 / 效率

稀疏注意力速览(Sparse Attention,2019 ~ 2026)

选 block 还是选 token:早期稀疏 + DeepSeek NSA/DSA/CSA/HCA + block/token 两派 + 厂商落地,26 篇。

推理加速 / 效率

推理加速速览(Inference Acceleration,2023 ~ 2026)

投机解码、multi-token prediction、Medusa/Hydra/EAGLE/Sequoia 草稿线,及 DFlash / DSpark 块扩散草稿,11 篇。

自我改进 / 对齐

递归自我改进速览(Recursive Self-Improvement,2003 ~ 2026)

自训练 / 自奖励 / 自博弈 / 自纠正 / 弱到强,及 AI Scientist、AlphaEvolve 等现代 RSI,27 篇。

RL / 后训练

LLM 强化学习速览(RL for LLMs,2017 ~ 2026)

GRPO → GSPO/GEPO → DAPO + credit assignment + GKD/OPD/OPSD/MOPD 蒸馏,23 篇。

Agent / 工程

Agent Harness 速览(2023 ~ 2026)

Codex / Claude Code / Kimi Code / Pi / DeepSeek 产品 + SWE-agent、Harness-1 等学术,19 篇。

世界模型 / 生成

世界模型速览(World Models,2018 ~ 2026)

MBRL 潜状态世界模型、Sora / Genie / Cosmos 视频世界模型、JEPA、交互式 / 具身 / 驾驶世界模型与评测,68 篇。