Grammar Induction / Unsupervised Parsing 速览
覆盖 2010 ~ 2026(含 2002-2009 源头)· 面向没读过这些论文的读者 · 检索时间 2026-08-23 · 每篇 = 配方 + 一句话(问题 / 方法 / 核心)
零基础读法:先搞清楚「句法」和「无监督」到底在做什么
定义:给定很多没有句法树标注的句子,让模型自动学出每个词之间的成分或依存关系。它不像监督解析那样有现成树做答案,只能从文本本身找结构线索。
方法:早期经典方法假设一个概率文法(PCFG 或依存模型),用 EM/变分推断去估计规则概率;谱方法用矩阵分解恢复隐变量;神经时代则用可微树、递归网络或 Transformer 的表示来诱导结构。近年还有一个问题:LLM 的 next-token 训练里是否天然涌现出句法。
模型:经典 DMV、PCFG;神经 DIORA、R2D2、Transformer Grammars、GPST;以及后来直接拿 BERT/GPT 做结构探测。
算法:最关键的是 inside-outside/动态规划,用来在句子上高效求和或求最大概率树;无监督学习常用 EM、变分 EM 或 next-token 损失。评价结构则用 F1 对比预测树和人工标注树。
评测:通常看 PTB/WSJ 上的无监督成分 F1、依存 UAS,或者看语言模型困惑度、句法泛化/层级泛化。分数高不等于真学到句法,还要看是否只是背表面搭配。
读每篇时问:它假设结构是显式文法还是隐式表示?训练信号是什么?怎么把学到的结构拿出来评?
0. 先看懂「配方」记法
| 记号 | 意思 |
|---|---|
pcfg(sentence) | 概率上下文无关文法(PCFG),在裸句上做 |
dmv(pos-seq) | 依存模型 + 配价(Dependency Model with Valence),在词性序列上做 |
spectral(sentence) | 谱方法(SVD 分解矩量)恢复潜变量文法 |
neural-pcfg / neural-dmv | 用神经网络参数化 PCFG / DMV 的分数或规则 |
diora / rnng / tree-lstm | 递归/树结构神经编码器 |
rnn / transformer / llm | 扁平循环网络 / Transformer / 预训练大语言模型 |
X_shared + Y_path | 结构记法:X 是共享主干,Y 是独立模块(如 transformer_shared + syntax_path) |
-> 预测 + 目标 | 诱导出什么结构 + 用什么目标/损失 |
成分树 / 依存树 / 文法 / 语法类别 | 预测目标:短语结构 / 依存结构 / 规则概率 / 离散语法类 |
MLE / EM / ELBO / 重建 / next-token / CE / SVD / 通信 | 目标:最大似然 / 期望最大化 / 变分下界 / 重建 / 下一词预测 / 对比估计 / 谱分解 / 多智能体交流 |
无监督句法分析(grammar induction)= 从没有标注树的裸文本里,学出句子的树结构(成分树或依存树)或背后的文法规则。核心难点是没有「正确树」可监督,模型只能靠「句子本身的可解释性」或「辅助信号」来学。
1. 主线:三代 + 三个轴在收敛
- 经典/谱方法(2010-2015):从裸文本学 PCFG/DMV,靠 EM / 变分 / 谱方法估计参数。受限于「易陷局部最优、质量低」。
- 神经方法(2016-2021):用神经网络参数化文法(Compound PCFG、DIORA、Ordered Neurons),把无监督成分解析 F1 从 40+ 推到 50+,是无监督句法的黄金期。
- LLM 时代(2022-2026):发现预训练大模型已「隐式内化语法」,重心从「怎么学」转向「怎么把已学会的语法逼出来」(probe / elicit / 结构化 Transformer)。
三个「轴」在同时收敛:
| 轴 | 从 | 到 | 代表 |
|---|---|---|---|
| 模型 | 显式文法(PCFG/DMV) | 隐式语法知识(LLM) | Spectral → Compound PCFG → LLM hashing |
| 目标 | MLE / EM | 重建 / next-token / probe | DMV → DIORA → hashing |
| 结构 | constituency 与 dependency 分立 | 逐渐统一 | Neural L-PCFG(同时做成分+依存) |
交点是一个开放问题:语法是「显式学出来的文法」,还是「LLM 里天然涌现的隐式结构」? 下面的每一代都在用不同方式回答它。
2. 逐篇配方 + 一句话
2.0 源头(2002-2009,奠定问题与 baseline)
在 2010 年之前,这个问题已经被定义清楚:从裸文本学出成分树或依存树。经典 PCFG/DMV 用 EM 变体估计,但都困在「局部最优 + 无标注」里。这一时期的几个思想——上下文特征(CCM)、贝叶斯正则(Johnson)、对比估计(Smith & Eisner)、在线 EM(Liang & Klein)——后来几乎全部被神经一代继承。
CCM:A Constituent-Context Model(Klein & Manning 2002)(ACL 2002)
pcfg(sentence) -> 成分树 + MLE(EM + split/merge)
问题 朴素 PCFG 的 EM 学出的规则太「平均」、树质量差;方法 给每个成分加「上下文」特征,再用 split/merge 自动扩展文法;核心 上下文特征 + 文法分裂合并,是无监督成分解析早期最强 baseline;后续 compound / neural PCFG 在 F1 上超过它,经典 CCM 的 EM+特征线基本被弃,但「上下文特征」思想被神经化继承。
DMV(Klein & Manning 2004)(ACL 2004)
dmv(pos-seq) -> 依存树 + MLE(EM)
问题 没有标注树怎么学依存;方法 head-outward 生成模型:每个词先选中心词、再向左右生成依存词,配价限制数量;核心 「依存 + 配价」模型成为之后十几年无监督依存解析的 baseline;后续在线 EM / 后验正则 / 神经 DMV 不断修它的局部最优与稀疏性,DMV 的 head-outward 结构被保留、经典 EM 线被神经化替代。
Variational Bayesian Grammar Induction(Kurihara & Sato 2006)(ICGI 2006)
pcfg(sentence) -> 文法 + ELBO(变分贝叶斯)
问题 经典 EM 易过拟合、文法不稀疏;方法 给 PCFG 规则加 Dirichlet 先验、近似后验;核心 贝叶斯正则让文法更稀疏、更泛化。
Bayesian Inference for PCFGs via MCMC(Johnson et al. 2007)(NAACL 2007)
pcfg(sentence) -> 文法 + 后验采样(MCMC)
问题 MAP/EM 点估计过拟合、不稳定;方法 用 Dirichlet 先验 + MCMC 采样整条后验分布;核心 完全贝叶斯推断(采后验而非点估计)让文法更稳更好。
Contrastive Estimation(Smith & Eisner 2005)(ACL 2005)
loglinear(sentence) -> 文法 + 对比估计(CE)
问题 无标注下 MLE 的配分函数难算、模型易退化;方法 把「真样本的邻域/噪声样本」当隐式负例、真样本当正例做对比;核心 对比估计 = 无监督判别式训练 log-linear 文法;后续 Painless / 特征化 CCM 继承 CE 思想,再后来被神经对比目标取代——「噪声样本当负例」的思想被保留、经典 log-linear 线被弃。
Online EM for Unsupervised Models(Liang & Klein 2009)(NAACL 2009)
dmv(pos-seq) -> 依存树 + online EM
问题 批量 EM 慢且易过拟合;方法 逐句更新 + 新旧统计量插值(步长随迭代衰减);核心 在线 EM 让 DMV 更快更稳、F1 明显提升;后续 Baby Steps 指出它仍会陷进坏局部最优,加短句起步课程——online EM 的插值步长被保留、初始化被改。
Probabilistic CFG with Latent Annotations(Matsuzaki, Miyao & Tsujii 2005)(ACL 2005)
latent-pcfg(sentence) -> 成分树 + MLE(EM,隐标注)
问题 朴素 PCFG 非终结符太粗、表达力弱;方法 给每个非终结符加隐标注(子类别)、用 EM 学标注的划分;核心 隐标注 PCFG 是后续所有潜变量 PCFG(谱/神经)的奠基。
An All-Subtrees Approach to Unsupervised Parsing / U-DOP(Bod 2006)(COLING-ACL 2006)
dop(sentence) -> 成分树 + 全子树(PCFG 归约)
问题 无监督解析如何利用「所有可能子树」;方法 U-DOP 给句子赋所有无标注二叉树、再把子树归约成 PCFG;核心 数据驱动(DOP)思路的无监督版,比 DMV 更结构化。
The Infinite PCFG Using Hierarchical Dirichlet Processes(Liang, Petrov, Jordan & Klein 2007)(EMNLP-CoNLL 2007)
hdp-pcfg(sentence) -> 文法 + 后验采样(非参贝叶斯)
问题 文法子类别数量要预先定、定错就废;方法 用层次狄利克雷过程(HDP)让子类别数量从数据自动学;核心 非参数 PCFG,符号数量自适应。
Fast Unsupervised Incremental Parsing / CCL(Seginer 2007)(ACL 2007)
ccl(sentence) -> 成分树 + 启发式(左右上下文学习)
问题 需要又快又好的无监督 parser 当 baseline;方法 CCL 用「左右上下文」学习相邻词聚类、增量构建成分;核心 CCL 成为之后十几年的标准无监督 baseline。
2.1 经典 / 谱方法(2010-2015)
这一代靠「统计模型 + 无监督目标」从裸文本学文法:PCFG 用 EM/变分估计规则概率,DMV 用 head-outward 生成学依存,谱方法用 SVD 给出有相合性保证的估计。两条主线:一是「怎么跳出局部最优」(后验正则、少即是多、计数变换),二是「怎么给出有理论保证的估计」(谱方法)。核心矛盾是质量低、易陷局部最优,为神经一代埋下伏笔。
Posterior Regularization(Ganchev et al. 2010)(JMLR 2010)
pcfg/dmv(sentence) -> 文法 + 后验正则(加约束)
问题 无监督文法学习没有地方注入先验知识;方法 在 EM 的后验分布上加约束(如期望=某先验),投影到满足约束的分布族;核心 后验正则 = 给 EM 后验套「弱监督/先验」的通用接口。
Sparsity in Dependency Grammar Induction(Gillenwater et al. 2010)(ACL 2010)
dmv(pos-seq) -> 依存树 + 稀疏后验正则
问题 DMV 学出的后验过密、出现大量低概率弧;方法 用后验正则把「每词依赖数少」编码成 L1 稀疏约束;核心 稀疏性是让无监督依存真正可用的关键先验。
Unsupervised Induction of Tree Substitution Grammars(Blunsom & Cohn 2010)(EMNLP 2010)
tsg(sentence) -> 依存文法 + 后验采样(非参贝叶斯 Gibbs)
问题 DMV 结构太简单、学不出多词搭配和子结构;方法 树替换文法(TSG)+ 非参数贝叶斯(Pitman-Yor)让文法规模随数据自适应;核心 非参数文法比固定 DMV 更能捕获搭配。
From Baby Steps to Leapfrog(Spitkovsky et al. 2010)(NAACL 2010)
dmv(pos-seq) -> 依存树 + Viterbi EM(课程:短句→长句)
问题 EM 直接在长句上初始化会陷进坏局部最优;方法 「少即是多」——从长度=1 的句子开始逐步加长、Viterbi EM 热启动;核心 课程学习/短句起步让无监督依存 F1 大幅跃升;后续 Breaking Out of Local Optima 指出只靠初始化还不够,再加计数变换/模型重组——短句起步的课程思想被保留。
Unambiguity Regularization(Tu & Honavar 2012)(EMNLP 2012)
spectral-pcfg(sentence) -> 文法 + 无歧义正则
问题 无监督文法会学出「一句话多种歧义解析」的坏解;方法 加「每个句子的解析应尽量唯一」的正则、惩罚歧义;核心 无歧义正则 = 结构清晰度先验。
Spectral Learning of Latent-Variable PCFGs(Cohen et al. 2012)(ACL 2012)
spectral(sentence) -> 潜文法 + SVD(矩匹配)
问题 EM 只有局部最优、无一致性保证;方法 把可观测的 inside/outside 矩量做 SVD,在「分离性」条件下恢复潜规则参数、有相合性证明;核心 谱方法 = 全局最优、可证明一致的文法估计;后续工程版指出负概率、平滑难调、真实文本上仅接近 EM,神经化 compound PCFG 取代谱方法——「全局最优 + 一致性」的理论遗产被保留。
Experiments with Spectral L-PCFGs(Cohen et al. 2013)(NAACL 2013)
spectral(sentence) -> 潜文法 + SVD(真实文本工程化)
问题 谱方法只有理论、从未在真实文本上跑过;方法 把谱 L-PCFG 真正实现、系统测在 WSJ,处理平滑/正概率等工程;核心 首次证明谱方法在真实句法解析上可行、接近 EM 且有保证。
Breaking Out of Local Optima(Spitkovsky et al. 2013)(ACL 2013)
dmv(pos-seq) -> 依存树 + 计数变换/模型重组(EM)
问题 好的初始化仍会掉进局部最优;方法 对计数做变换(如开方)+ 多模型重组/再训练来跳出局部最优;核心 计数变换 + 重组 = 逃离局部最优的实用技巧。
Unsupervised Dependency Parsing: Let's Use Supervised Parsers(Le & Zuidema 2015)(NAACL 2015)
dmv(pos-seq) + 监督parser先验 -> 依存树 + 迭代重排(self-training)
问题 纯无监督 DMV 质量低、瓶颈明显;方法 用现成监督 parser 的输出当先验、迭代重排(iterated reranking)自我训练;核心 借监督 parser 的力量提升无监督依存,是「自训练」的早期成功。
Optimizing Spectral Learning for Parsing(Shain et al. 2016)(1606.02342)
spectral(sentence) -> 潜文法 + SVD(平滑/去负概率)
问题 谱估计出负概率、模型容量与平滑难调;方法 平滑 + 重参数化消除负概率、系统调模型规模;核心 补齐工程短板,让谱方法 F1 追上 EM。
Painless Unsupervised Learning with Features(Berg-Kirkpatrick, Bouchard-Côté, DeNero & Klein 2010)(NAACL 2010)
loglinear(sentence) -> 文法 + 对比/伪负采样(特征)
问题 无监督学习难用丰富特征;方法 用 log-linear + 局部配分函数近似,把特征「无痛」加进无监督模型;核心 特征化的无监督 log-linear 文法。
A Feature-Rich Constituent Context Model(Golland, DeNero & Uszkoreit 2012)(ACL 2012)
ccm(sentence) -> 成分树 + MLE(特征化上下文)
问题 CCM 只用简单上下文、缺丰富特征;方法 给 CCM 加丰富特征、用 EM 训练;核心 特征化的 CCM 让经典无监督成分解析更强。
Three Dependency-and-Boundary Models(Spitkovsky, Alshawi & Jurafsky 2012)(EMNLP 2012)
dmv+boundary(pos-seq) -> 依存树 + EM(边界信息)
问题 DMV 只用词性、忽略词边界/相邻信息;方法 提出 Dependency-and-Boundary 一族模型、把边界信息并入;核心 边界信息是无监督依存的重要线索。
Collapsed Variational Bayesian Inference for PCFGs(Wang & Blunsom 2013)(CoNLL 2013)
pcfg(sentence) -> 文法 + 塌缩变分(CVB)
问题 PCFG 变分推断的内存/速度瓶颈;方法 塌缩掉规则参数、只对树做变分(CVB);核心 更快的贝叶斯 PCFG 推断。
2.2 神经方法(2016-2021)
这一代把「文法」交给神经网络参数化:用连续向量给规则/弧打分(Neural DMV、Compound PCFG),或用重建目标诱导隐树(DIORA、CRF-AE),甚至把树结构直接编进网络(Ordered Neurons)。词法化 PCFG 一路被推进——从单中心词到双词法化(Yang 的 Bi-Lexicalized)、再到张量分解撑起多符号文法(PCFGs Can Do Better);可微递归 transformer(R2D2 → Fast-R2D2)则把「潜树 + 层级语言建模」做进了 Transformer,并用剪枝 CKY 把它推到可规模化。同时冒出「从预训练模型里探测句法」(structural probe、perturbed masking)这条支线,成为进入 LLM 时代的桥。无监督成分解析 F1 从 40+ 一路推到 50+,是无监督句法的黄金期。
Unsupervised Neural Dependency Parsing(Jiang et al. 2016)(EMNLP 2016)
neural-dmv(pos-seq) -> 依存树 + MLE(神经打分)
问题 DMV 用离散查表分数、捕捉不了上下文;方法 用神经网络给每条依存弧打分,替代离散分数;核心 神经化 DMV,无监督依存解析质量跃升。
Learning to Compose Words into Sentences with RL(Yogatama et al. 2017)(1611.09100,ICLR 2017)
tree-lstm(sentence) -> 成分树 + REINFORCE(LM reward)
问题 树是离散结构、不可微;方法 把「选树」当策略、用强化学习以语言模型困惑度为奖励优化;核心 RL 训练离散潜树,无需标注。
CRF Autoencoder for Unsupervised Dependency Parsing(Cai et al. 2017)(1708.01018)
neural-crf(sentence) -> 依存树 + 重建(自编码)
问题 依存解析缺一个「表征学习」目标;方法 用 CRF 做隐树、把句子编码成树再重建回词;核心 「编码成树、重建句子」作为无监督目标。
PRPN(Shen et al. 2018)(1706.04165,ICLR 2018)
rnn(sentence) -> 成分树 + next-token(syntactic distance 门控)
问题 想边学语言模型边学句法、让二者互相促进;方法 PRPN 用「句法距离」+ 注意力门控让更近的词有更强交互、next-token 训练;核心 潜树 + 语言模型联合训练,树从 next-token 里涌现。
Learning to Compose Task-Specific Tree Structures(Choi et al. 2018)(1707.02786,AAAI 2018)
gumbel-tree-lstm(sentence) -> 树 + 任务损失(Gumbel-Softmax)
问题 树组合操作不可微;方法 用 Gumbel-Softmax 采样离散组合、走 straight-through 梯度;核心 可微的离散树,端到端学任务专属结构。
Compound PCFG(Kim et al. 2019)(1906.10225)
neural-pcfg(sentence) -> 成分树 + MLE(compound 分布)
问题 普通神经 PCFG 的规则概率被句子级向量 z 约束、表达力弱;方法 compound 分布让规则概率随连续 z 采样变化;核心 连续潜变量 + 神经参数化 = 无监督成分解析 SOTA。
Neural PCFG(Kim et al. 2019)(ACL 2019)
neural-pcfg(sentence) -> 成分树 + MLE(inside-outside)
问题 让神经网络直接生成 PCFG 规则;方法 神经网络给规则打分、inside-outside 求 MLE;核心 神经 PCFG 基线(compound 的简化版)。
DIORA(Drozdov et al. 2019)(1904.02142)
diora(sentence) -> 成分树 + inside-outside 重建
问题 想同时学树和成分表征、且保证内外一致;方法 inside-outside 递归自编码器,用 outside 表征重建每个叶子词;核心 重建目标诱导隐树,F1 大幅提升。
URNNG(Kim et al. 2019)(NAACL 2019)
neural-rnng(sentence) -> 成分树 + ELBO(无监督)
问题 想无监督学「显式树」的神经文法;方法 无监督训练递归神经文法 RNNG、用变分下界;核心 无监督显式树结构神经文法。
Ordered Neurons / ON-LSTM(Shen et al. 2019)(1810.09536)
rnn(sentence) -> 树结构 + next-token(master 门控)
问题 怎么把树结构隐式塞进扁平 RNN;方法 神经元排序、master 输入/遗忘门保证「更新顺序=树」、用 cumax;核心 cumax 门控让 LSTM 隐式编码语法树。
Imitation Learning for Unsupervised Parsing(Li et al. 2019)(ACL 2019)
tree-lstm(sentence) -> 树动作 + 模仿学习(学 PRPN)
问题 PRPN 只有软树、没有显式可用的解析器;方法 让离散 parser 模仿 PRPN 的树动作;核心 模仿学习把软树蒸馏成显式解析器。
Dependency Grammar Induction with a Neural Variational Transition-Based Parser(Li et al. 2019)(AAAI 2019)
neural-transition(sentence) -> 依存树 + ELBO(变分转移系统)
问题 依存文法诱导缺一个推理快($O(n)$)又能变分推断的神经 parser;方法 神经转移系统 parser + 变分推断做 grammar induction;核心 变分转移系统把无监督依存诱导做进神经 parser。
Differentiable Perturb-and-Parse(Corro & Titov 2019)(1807.09875,ICLR 2019)
structured-vae(sentence) -> 成分树 + ELBO(perturb-and-map)
问题 在树空间上做变分、边缘化难;方法 perturb-and-map(Gumbel 扰动后取最优树)做可微采样;核心 可微 DP 让结构化变分自编码器端到端训练。
Visually Grounded Neural Syntax Acquisition(VG-NSL,Shi et al. 2019)(1906.02890,ACL 2019)
neural-parser(sentence+image) -> 成分树 + REINFORCE(图文对齐 reward)
问题 纯文本的句法信号太弱;方法 用图文匹配(视觉 grounding)给 parser 提供 REINFORCE 奖励;核心 视觉信号辅助语法归纳。
A Structural Probe for Finding Syntax(Hewitt & Manning 2019)(1903.06876,NAACL 2019)
probe(embeddings) -> 树距离 + 线性回归
问题 词向量里是否编码了句法树;方法 训练线性探针从词表示预测「两词在树中的距离/深度」;核心 BERT 词向量几何已编码句法树,奠定 probing 范式。
Neural Lexicalized PCFG(Zhu et al. 2020)(2007.15135)
neural-lpcfg(sentence) -> 成分+依存树 + MLE(词法化)
问题 神经 PCFG 丢掉词法信息、成分与依存割裂;方法 词法化神经 PCFG、同时做依存和成分;核心 「词法依存回归」统一两种树结构。
Neural Bi-Lexicalized PCFG Induction(Yang, Zhao & Tu 2021)(2105.15021,ACL 2021)
neural-bi-lpcfg(sentence) -> 成分+依存树 + MLE(双词法化)
问题 词法化 PCFG 的「单中心词独立」假设不合理;方法 双词法化让规则概率同时依赖中心词和非中心词、神经参数化控制复杂度;核心 去掉不合理的独立性假设,无监督解析更快更好。
PCFGs Can Do Better: Inducing PCFGs with Many Symbols(Yang, Zhao & Tu 2021)(2104.13727,NAACL 2021)
tensor-pcfg(sentence) -> 成分树 + MLE(张量分解/多符号)
问题 普通 PCFG 非终结符数量一多、参数和计算爆炸;方法 用张量分解参数化规则、让 PCFG 容纳大量符号、再神经化;核心 多符号 PCFG + 张量分解显著提升无监督解析、跨 10 语言有效。
Second-Order Unsupervised Neural Dependency Parsing(Yang, Jiang, Han & Tu 2020)(2010.14720,COLING 2020)
neural-dmv(pos-seq) -> 依存树 + MLE(二阶,参数共享)
问题 一阶 DMV 只看单条弧、信息不足;方法 二阶(祖辈/兄弟)扩展、用神经共享参数化解规则爆炸;核心 二阶依存信息 + 神经参数共享。
Heads-up! Constituency Parsing via Self-Attention Heads(2020)(2010.09517)
transformer(sentence) -> 成分树 + 自注意力头投票(无训练)
问题 transformer 里有没有现成的树;方法 把自注意力头当「相邻词合并」信号、从注意力图诱导成分树;核心 注意力头天然携带句法、几乎零训练。
S-DIORA(Drozdov et al. 2020)(EMNLP 2020)
diora(sentence) -> 成分树 + 单树重建
问题 DIORA 内外用两个不一致的树;方法 单一树编码(single tree)统一内外;核心 统一内外树,F1 再提 2-6 点。
Unsupervised Parsing via Constituency Tests(Cao, Kitaev & Klein 2020)(2010.03146,EMNLP 2020)
parser(sentence) -> 成分树 + 语言测试(伪标签)
问题 无监督缺少「成分是否存在」的信号;方法 用语言学成分测试(替换/移位)生成弱监督伪标签;核心 把语言学测试当弱监督信号。
An Empirical Comparison of Unsupervised Parsing(Li et al. 2020)(ACL 2020)
benchmark -> 统一 F1 评估
问题 各方法用不同树库/不同评估、数字不可比;方法 统一在 PTB 重训重评 8 种无监督成分解析方法;核心 给出第一个可比排行榜,暴露 F1 虚高来自评估差异。
Perturbed Masking(Wu et al. 2020)(2004.14786,ACL 2020)
bert(sentence) -> 树 + 扰动掩码探测
问题 BERT 的句法能力怎么无参数地测;方法 扰动某个 token、看其他 token 预测变化、构建影响图;核心 扰动掩码 = 无参数探测出依赖/成分结构。
Emergent Linguistic Structure(Manning et al. 2020)(PNAS 2020)
nn(sentence) -> 树结构 + 表示分析(自监督)
问题 自监督训练的神经网络是否真的学到层级句法;方法 分析内部表示、发现句法树结构自然涌现;核心 自监督(next-token/掩码)本身就能催生句法结构。
R2D2: Recursive Transformer based on Differentiable Tree(Hu et al. 2021)(2107.00967,ACL 2021)
recursive-transformer(sentence) -> 成分树 + next-token(可微 CKY)
问题 想用 transformer 做层级语言建模、同时诱导出可解释的树;方法 用可微 CKY 树把底层 transformer 编码的 span 自底向上递归组合、next-token 训练;核心 可微树 + 递归 transformer = 层级 LM 同时诱导成分树。
Fast-R2D2: Pretrained Recursive NN based on Pruned CKY(Hu, Mi, Li & de Melo 2022)(2203.00281,EMNLP 2022)
recursive-transformer(sentence) -> 成分树 + next-token(剪枝 CKY,top-down 并行)
问题 R2D2 的稠密 CKY 推理慢、内存高、没法规模化;方法 用一个轻量 top-down parser 做剪枝、只保留少量候选树,再并行递归编码;核心 剪枝 CKY 让 R2D2 快 30-50 倍,语法诱导和文本表征都更好。
Assessing the Ability of LSTMs to Learn Syntax-Sensitive Dependencies(Linzen, Dupoux & Goldberg 2016)(1611.01368,TACL 2016)
lstm(sentence) -> 语法一致性 + next-token(数一致探测)
问题 LSTM 是否真的学会句法;方法 用主谓数一致探测 LSTM 对长距离依赖的建模;核心 LSTM 能学部分句法、但结构建模仍不如显式树。
Jointly Learning Sentence Embeddings and Syntax with Unsupervised Tree-LSTMs(Shen et al. 2017)(1705.09189)
tree-lstm(sentence) -> 成分树 + 句子表征(无监督重建)
问题 能否无监督地同时学句子表征和树;方法 用无监督 Tree-LSTM 联合学句子 embedding 与隐树;核心 无监督树 LSTM 是 PRPN/DIORA 的前身。
Unsupervised Learning of Syntactic Structure with Invertible Neural Projections(He, Neubig & Berg-Kirkpatrick 2018)(1808.09111,EMNLP 2018)
invertible(sentence) -> 成分树 + MLE(可逆投影变分)
问题 潜变量文法难做高效精确的变分推断;方法 用可逆神经网络(invertible projections)做变分后验、让推断更精确;核心 可逆投影让潜树推断更准、无监督解析更好。
Unsupervised Grammar Induction with Depth-bounded PCFG(Jin, Doshi-Velez, Miller, Schuler & Schwartz 2018)(1802.08545,TACL 2018)
depth-pcfg(sentence) -> 成分树 + MLE(深度受限)
问题 PCFG 诱导的树往往过深/失衡;方法 给 PCFG 加深度上界、抑制过深树;核心 深度受限是无监督 PCFG 的关键正则。
Gaussian Mixture Latent Vector Grammars(Zhao & Titov 2018)(1805.04688,ACL 2018)
gmlvg(sentence) -> 成分+依存树 + ELBO(高斯混合潜变量)
问题 潜变量文法的表示能力与推断难平衡;方法 高斯混合潜向量文法(GMLVG)统一成分与依存;核心 Compound PCFG 的前身,潜变量文法统一两种树。
Grammar Induction with Neural Language Models: An Unusual Replication(Htut, Cho & Bowman 2018)(1808.10000,BlackboxNLP 2018)
prpn(sentence) -> 成分树 + next-token(严格复现/分析)
问题 PRPN 的结果是否可信、到底学了什么;方法 严格复现 PRPN 并分析其成功条件;核心 证实 PRPN 是首个成功的潜树 LM、但结论需谨慎解读。
Do Latent Tree Learning Models Identify Meaningful Structure?(Williams, Drozdov & Bowman 2018)(TACL 2018)
latent-tree(sentence) -> 树 + 下游任务(结构评估)
问题 潜树模型学到的树是否真有语言意义;方法 系统评估各潜树模型的树与真实句法的一致性;核心 很多潜树模型学到的「树」并不对应真实句法。
Unsupervised Learning of PCFGs with Normalizing Flow(Jin, Doshi-Velez, Miller, Schwartz & Schuler 2019)(ACL 2019)
flow-pcfg(sentence) -> 成分树 + MLE(normalizing flow 发射)
问题 离散发射对稀有/形态复杂词数据稀疏;方法 用 normalizing flow 把上下文词向量建模成连续发射分布;核心 连续发射 + 可逆变换让 PCFG 用上词向量。
Inducing Syntactic Trees from BERT Representations(Rosa & Mareček 2019)(1906.11511)
bert(sentence) -> 成分树 + 向量距离(无监督诱导)
问题 BERT 表示里能否直接读出句法树;方法 用词向量距离/线性变换从 BERT 表示诱导成分树;核心 预训练表示可直接用于无监督成分诱导。
Are Pre-trained Language Models Aware of Phrases?(Kim, Choi, Edmiston & Lee 2020)(2002.00737,ICLR 2020)
plm(sentence) -> 成分树 + 简单基线(短语感知)
问题 预训练 LM 是否已感知短语结构;方法 提出简单强 baseline 从 PLM 诱导短语/成分;核心 PLM 已隐式感知短语、简单方法就能抽取树。
Visually Grounded Compound PCFGs(Zhao & Titov 2020)(2009.12404,EMNLP 2020)
compound-pcfg(sentence+image) -> 成分树 + ELBO(视觉 grounding)
问题 纯文本 compound PCFG 的树可能不对齐语义;方法 给 compound PCFG 加视觉 grounding 信号;核心 视觉信号让 compound PCFG 的树更有语义。
An Empirical Study of Compound PCFGs(Zhao & Titov 2021)(2103.02298)
compound-pcfg(sentence) -> 成分树 + MLE(系统消融)
问题 compound PCFG 哪个组件真正起作用;方法 系统消融潜变量/参数化/训练细节;核心 厘清 compound PCFG 的关键设计、给后续改进指路。
StructFormer: Joint Unsupervised Induction of Dependency and Constituency(Shen et al. 2021)(2012.00857,ACL 2021)
transformer(sentence) -> 依存+成分树 + masked-LM(结构偏置)
问题 怎么把树结构做进 Transformer;方法 StructFormer 同时诱导依存和成分结构、用 masked LM 训练;核心 结构偏置 + masked LM,Transformer 里长出树。
Sequence-to-Sequence Learning with Latent Neural Grammars(Kim 2021)(2109.01135,NeurIPS 2021)
qcfg(sentence) -> 成分树 + ELBO(潜语法 seq2seq)
问题 把潜语法接进 seq2seq 生成;方法 用 quasi-synchronous CFG(QCFG)做潜变量语法 + 变分推断;核心 潜神经语法让 seq2seq 学习可解释的结构。
2.3 LLM 时代(2022-2026)
这一代发现预训练大模型已经「隐式内化语法」,重心转向三件事:从 LLM 里 elicit/probe 出树(hashing、树投影、扰动掩码、contextual distortion),给结构 Transformer 加显式句法归纳偏置(GPST、组合句法 SLM),以及用合成 PCFG 数据做「何时/为何涌现层级」的理论与实证(Ahuja、Cagnetta)。同时有一条「显式文法复兴」支线:把无监督解析推到过去做不到的不连续成分(Yang 的 LCFRS-2)。问题从「怎么学」变成「怎么把已学会的语法逼出来」。
Unsupervised Discontinuous Constituency Parsing(Yang, Levy & Kim 2023)(2212.09140,ACL 2023)
lcfrs-2(sentence) -> 不连续成分树 + MLE(张量分解)
问题 现有无监督解析都假设成分连续、学不了德/荷语的「不连续成分」;方法 用 LCFRS-2(fan-out=2 的轻度上下文敏感文法)固定规则结构、MLE 学参数;核心 首次无监督学出不连续成分、把文法扩展到轻度上下文敏感。
Contextual Distortion Reveals Constituency(Li & Lu 2023)(2306.00645,ACL 2023)
mlm(sentence) -> 成分树 + 上下文失真评分(chart)
问题 MLM 里已隐含句法、怎么无训练地抽树;方法 mask 一个 span、看它内部词预测被「扭曲」多少、用 chart 算法组树;核心 上下文失真 = MLM 是隐式 parser,无需训练直接抽树。
Re-evaluating Multimodal Signals / LC-PCFG(Zhang et al. 2024)(2212.10564,NAACL 2024)
neural-pcfg(sentence) + llm-emb -> 成分树 + MLE
问题 有工作宣称视觉信号对语法归纳不可或缺;方法 纯文本 LC-PCFG 只用 LLM 词嵌入;核心 LLM 嵌入足以让文本 baseline 反超多模态方法,多模态非必需。
Characterizing Intrinsic Compositionality with Tree Projections(Murty et al. 2023)(2211.01288,ICLR 2023)
transformer(sentence) -> 树 + 线性投影(PPSL)
问题 transformer 的组合是否是「树状组合」;方法 把 transformer 各层线性投影到树结构模型上、比较重构误差;核心 transformer 学到近似树状组合(但不完全是)。
Learning Syntax Without Planting Trees(Ahuja et al. 2024)(2404.16367)
transformer(sentence) -> 语法泛化 + next-token(合成 PCFG 数据)
问题 transformer 何时、为何能层级泛化;方法 在 PCFG 合成数据上系统控制变量(深度/宽度/位置编码);核心 层级泛化来自 next-token 预训练,不需要显式树偏置。
Towards a Theory of Structure Acquisition(Cagnetta et al. 2024)(2406.00048)
dnn(sentence) -> 文法 + next-token(理论分析)
问题 DNN 学语法的理论机制是什么;方法 在 PCFG 生成数据上给出 next-token 预测→学出语法的理论刻画;核心 给「结构如何在 DNN 中习得」提供理论。
On Eliciting Syntax from LMs via Hashing(Wang & Utiyama 2024)(2410.04074,EMNLP 2024)
llm(sentence) -> 成分树 + 对比 hashing(CKY)
问题 从预训练 LLM 里「提取」语法树;方法 把 span 二值化、对比学习学 hash、位级 CKY 解码;核心 LLM 已隐式内化语法,hashing 把它逼出来。
GPST:Generative Pretrained Structured Transformers(2024)(2403.08293)
transformer_shared + syntax_path(sentence) -> 成分树 + next-token
问题 带显式句法结构的 LM 能否扩到大规模;方法 生成式预训练结构化 Transformer(共享主干 + 独立句法路径做 next-token);核心 结构化 Transformer 可扩展到 LLM 规模且句法泛化更好。
Unsupervised Acquisition of Discrete Grammatical Categories(2025)(2503.18702)
multi-agent(sentence) -> 离散语法类别 + 通信(符号交流)
问题 名词/动词等离散语法类别能否从零涌现;方法 多智能体参照游戏里用离散符号交流、通信压力迫使类别涌现;核心 通信压力是离散语法类别涌现的驱动力。
A Systematic Study of Compositional Syntactic Transformer LMs(Zhao et al. 2025)(2506.22978)
transformer_shared + bottomup_composer(sentence) -> 成分树 + next-token(统一框架)
问题 各结构化句法 LM 设计空间混乱、不知哪些设计真正起作用;方法 统一框架拆 4 个设计轴(树形式/线性化/组合函数/子成分掩码)穷举 13 变体;核心 系统回答「哪些设计决定句法泛化与效率」。
Grammar Induction from Visual, Speech and Text(Zhao et al. 2025)(AIJ 2025)
parser(sentence+speech+image) -> 成分树 + triplet 排序 loss(多模态对齐)
问题 视觉 grounding 只覆盖图文、没用到语音信号;方法 把 VG-NSL 扩展到语音+文本+图像,用 triplet 排序 loss 对齐;核心 多模态(视觉/语音/文本)信号共同辅助语法归纳。
Holographic Neural PCFG / Hol-PCFG(2026)(2607.08063)
neural-pcfg(sentence) -> 成分树 + MLE(全息 circular correlation)
问题 语法符号 embedding 只有加法/拼接、组合力弱;方法 用全息(HolE)循环相关把父符号与左右子符号「绑定」成代数关系;核心 全息组合增强神经 PCFG 表达力、参数大减。
Transformer Grammars(Sartran, Barrett, Kuncoro, Stanojević, Blunsom & Dyer 2022)(2203.00633,TACL 2022)
transformer + pcfg(sentence) -> 成分树 + next-token(显式语法层)
问题 大规模 Transformer LM 缺显式句法偏置;方法 在 Transformer 上加 PCFG 句法层、联合 next-token 训练;核心 显式语法 + Transformer 可扩展、句法泛化更好。
How to Plant Trees in Language Models(Murty, Sharma, Andreas & Manning 2023)(2305.19905,ACL 2023)
transformer(sentence) -> 语法偏置 + next-token(数据/架构消融)
问题 层级归纳偏置到底来自数据还是架构;方法 系统研究数据与架构对句法涌现的影响;核心 数据分布(而非架构)才是句法偏置的主要来源。
Sudden Drops in the Loss: Syntax Acquisition and Simplicity Bias(Chen et al. 2023)(2309.07311)
mlm(sentence) -> 语法习得 + 损失相变分析
问题 MLM 何时、如何突然学会句法;方法 分析训练中损失的「突降」与句法能力的对应;核心 句法习得是相变式的、与简单性偏置有关。
Ensemble Distillation for Unsupervised Constituency Parsing(Shayegh et al. 2023)(2310.01717)
ensemble(sentence) -> 成分树 + 蒸馏(多模型平均)
问题 单一无监督 parser 的树不稳定;方法 集成多个 parser 的树再蒸馏成单个模型;核心 集成 + 蒸馏显著提升无监督成分解析 F1。
3. 共识与分歧(速记版)
共识:
- 预训练 LLM 已经隐式学到语法(probing 证据充分),无监督解析的重心从「学文法」转向「提取语法」。
- 神经参数化(Compound PCFG 系列)是经典无监督成分解析的 SOTA,F1 约 50-60。
- constituency(成分)比 dependency(依存)在无监督设置下更好做。
- 评估基准混乱是一大问题(各用不同数据/指标),需要统一 benchmark。
分歧 / 难点:
- 显式文法 vs 隐式结构:还需要学出「显式文法」,还是 LLM 的隐式语法知识就够?两派各有拥趸。
- constituency vs dependency:哪种结构更本质、更该优先,尚无定论。
- evaluation 本身:F1 对「未标注树」的评估有争议,不同树表示(二叉/多叉)不可直接比。
- 多模态是否必要:早期说视觉信号关键,但 LC-PCFG 证明纯文本 + LLM 嵌入更优,结论被反复拉锯。
- 老任务是否被 LLM 消解:无监督解析还有独立价值,还是只是 LLM probing 的一个子问题。
- 不连续成分:主流无监督解析只处理连续成分,德/荷等语言的不连续结构(Yang 2023 刚起步)仍是未解前沿。
- 潜树是否「有意义」:Williams 2018 指出很多潜树模型学到的树不对应真实句法;Murty 2023 进一步发现句法偏置主要来自数据分布而非架构,二者都质疑「显式结构」到底学没学到。
说明:本文通过交叉引用各论文的参考文献列表补齐了 81 篇(隐标注 PCFG、U-DOP、无限 PCFG、CCL、normalizing flow PCFG、可逆投影、深度受限 PCFG、GMLVG、StructFormer、潜神经语法、Transformer Grammars、Murty / Sudden-Drops / Ensemble-Distillation 等)。经典早期论文用 aclanthology/JMLR 链接,2016 以后的神经与 LLM 论文多为 arXiv,编号均已核对。