文本归因--调研与当前挑战
2025-11-19
LLM的归因研究现状:生成式模型中的词元级归因 (2020–2025)
调研概述
本次调研主要聚焦于生成式语言模型(LLM)中的词元级归因 (Token-Level Attribution),涵盖了从2020年到2025年的关键进展。
文本归因核心问题: 当一个大型语言模型(LLM)生成一个特定的词(token) 时,它是“看”了输入 中的哪些词才做出这个决定的?
与分类模型不同,生成式模型是自回归的:它们每生成一个词 ,都可能依赖于原始输入 和之前生成的所有词 。因此,对于一个长篇的生成文本,我们可能需要一个“归因图”矩阵,展示每个输出词对每个输入词的依赖程度。
关键进展:从分类到生成式归因
1. ERASER:一个用于评估“合理化”NLP模型的基准 (ACL 2020) – Jay DeYoung et al.
类型: 词元级“基本理由” (Rationale) 评估的基准数据集和评估框架。
主要贡献:
-
引入了 ERASER 基准,包含多项 NLP 任务的数据集,其中带有人类标注的词元或句子级的“基本理由”(即支持模型预测的证据)。
-
定义了评估解释质量的标准指标,衡量模型生成的“基本理由”与人类标注的对齐程度(合理性, Plausibility),以及对模型决策过程的忠实性(Faithfulness)。
评估指标:
-
忠实性度量: 提出了全面性 (Comprehensiveness) 和 充分性 (Sufficiency) 得分,通过测试移除或仅保留“基本理由”词元对模型预测的影响来评估。
-
对齐指标: 使用 IOU/F1 分数来量化模型认为重要的词元与人类认为重要的词元之间的匹配程度。
💡 拓展: ERASER 是该领域的奠基之作,它明确区分了:
合理性 (Plausibility): 解释是否符合人类直觉(用 F1/IOU 等对齐指标衡量)。
忠实性 (Faithfulness): 解释是否真实反映了模型的决策过程(用 Comprehensiveness 和 Sufficiency 衡量)。
2. 序列预测的“基本理由” (EMNLP 2021) – Keyon Vafa, Yuntian Deng, David Blei, Alexander Rush
类型: 针对自回归序列模型的、基于干预 (Intervention-based) 的归因方法。
方法 (贪婪合理化):
-
将序列生成的词元级“基本理由”定义为:能够产生与使用完整输入时相同输出的最小输入词元子集。
-
提出了一种贪婪搜索算法:迭代地从输入中移除词元,直到模型的预测发生改变。
-
需要对模型进行短暂的微调,使其能够处理带有缺失词元(空白)的输入。
主要贡献:
-
首次解决了自回归生成任务的词元级解释问题。
-
与基于梯度和注意力的基线方法相比,该贪婪方法更忠实地优化了所定义的“最小子集”目标。
-
证明了“贪婪合理化”可以识别出在语言建模和机器翻译中对于生成输出真正必要的上下文词汇。
💡 拓展: 这项工作是从 NLU 归因到 NLG 归因的关键一步。其核心挑战是生成模型的归因是动态的。但该方法是白盒/灰盒的,因为它需要对模型进行微调。
3. 融合归因重要性以改进忠实性指标 (ACL 2023) – Zhixue Zhao, Nikolaos Aletras
类型: 针对归因忠实性提出的新型评估指标。
问题与动机:
- 先前的指标(如 ERASER 中的 Comprehensiveness 和 Sufficiency)使用硬擦除 (hard erasure) 策略(完全移除或保留 Top-K 个最重要的词元),这会扭曲输入分布 (out-of-distribution, OOD),导致测量不可靠。
主要贡献:
-
提出了 软归一化充分性 (Soft Normalized Sufficiency, Soft-NS) 和 软归一化全面性 (Soft Normalized Comprehensiveness, Soft-NC),它们使用一种**“软擦除” (soft erasure)** 标准。
-
新方法是根据每个词元的重要性得分,按比例随机地遮蔽 (mask) 该词元嵌入 (embedding) 的一部分,而非完全移除。
-
消除了需要选择一个任意的“基本理由”长度 () 的限制,使得评估更加公平和鲁棒。
💡 拓展: 这是对 ERASER 评估体系的一次重要“补丁”,通过更温和、更符合分布的干预方式(在嵌入空间中扰动),得出的忠实性度量更可靠。
4. ReAGent:用于生成式 LM 的递归归因生成器 (ACL 2024) – Zhixue Zhao et al.
类型: 针对 Decoder-only LLM 的模型无关归因方法(支持黑盒使用)。
方法 (带替换的迭代遮蔽):
-
ReAGent 通过迭代地替换输入的部分内容,并测量其对“下一词元预测”的影响来计算词元重要性。
-
它重复选择输入词元的子集,并用由外部语言模型 (RoBERTa) 生成的替代词元来替换它们(上下文感知替换)。
-
无梯度 () 和无注意力 ():它将目标 LM 视为黑盒,只需要前向传播来获取概率。
实验结果:
- 在长程一致性、问答、传记生成等任务上,通过 Soft-NS 和 Soft-NC 指标测量,ReAGent 始终产生最忠实的归因,显著优于基于梯度和注意力的方法。
💡 拓展: ReAGent 解决了前面几篇论文的痛点:它既是黑盒(解决了 Vafa (2021) 的灰盒限制),又使用了**“智能”扰动**(解决了 Soft-NS/NC 中的“嵌入遮蔽”问题),代表了当前黑盒 LLM 可解释性的前沿方向。
形式化设置与生成任务归因指标
1.1 形式化设置
输入序列:
这里 是“归因单位”(可以是 token / word / chunk)。
任务质量函数:
其中 是任务 reward(ROUGE/BLEU/EM 等), 是(可能存在的)参考答案。一个归因方法给出每个单位的重要性 。
干预与曲线:
-
对任意排序 ( 最重要),定义 prefix 集合 , 。
-
删除场景 (Deletion): 比较曲线 。
-
插入场景 (Insertion): 比较曲线 。
1.2 指标设计:似然视角 vs 任务视角
(a) 似然视角:Log-Likelihood AUC
质量函数定义: 给定参考输出 :
归一化删除曲线:
其中 。
Deletion-AUC (LL) 定义:
直觉:删得越早就把性能打趴, 越快接近 0,AUC 越大,说明方法越 faithful。
优点: 无需实际采样输出,可复现、方差小。
(b) 任务视角:Semantic AUC
质量函数定义: 在有参考答案 或任务 reward 时:
实际计算时用 Monte Carlo 估计 。
指标名称: 、。
优点: 和任务指标、对齐度更近,可以评估“是否遵循指令/是否保持事实一致”。
建议: 明确定义两类 AUC:
-
Likelihood-Faithfulness:
-
Task-Faithfulness:
2. 在现有 Benchmark 上构建归因数据集
我们希望构建数据集 ,其中 是一组 ground-truth 重要单位(rationales)。
基于现有 benchmark 的构造策略
| 任务类型 | 构造思路(以自动化为主) |
|---|---|
| (a) 抽取式 QA / Evidence-based QA (如 HotpotQA, FEVER) | 利用官方标注的 supporting sentences/evidence sentences,并校验这些 evidence 在“当前 LM”下仍然是必要的 ()。 |
| (b) 摘要 (Summarization) 类 | 单位: 句子或短段为主。用 ROUGE / BERTScore 对每个输入句子测其对摘要 的**“边际贡献”** 。选出 最高的句子,再进行**“最小充分集”**筛选。 |
| (c) 数学 / 推理 (CoT 类) (如 GSM8K) | 输入侧: 把题干中的数字、条件句、关键短语标注为 rationale。输出侧: 把 Chain-of-Thought (CoT) 拆成若干 step 作为单位(用于“输出归因”)。 |
| (d) 指令遵循 / 对话类 | 人工设计或自动挖掘指令中的**“约束/条件”**片段,标记为 。对 LM 做对照实验,删除这些片段,看输出是否明显破坏相应属性。 |
用黑盒模型反推 Rationale(必要集)
更结构化的方案是把 rationale 定义为近似最小必要集 ,满足:
-
Necessity:
-
Minimality:
这样构造出的 可以视作:当下这个 LM 下的“行为必要证据”,天然适合作为归因方法的评估真实标签 (ground truth)。
3. 黑盒归因的基本单位:Token / Word / Chunk
单位选择是构建 benchmark 的前置条件。
单位划分函数:
其中 是模型内部的 subword token, 是归因单位。
多尺度策略:
-
微观:Subword Token 级
-
。
-
优点: 和模型内部完全对齐,适合理论分析。
-
-
中观:Word / Phrase 级
-
用 tokenizer 的词边界合并 subword,得到词级;可进一步合并为短 phrase。
-
优点: 人类最易理解的粒度。
-
-
宏观:Chunk / Sentence 级
-
按句号、段落切分;限制 chunk 长度在 token 之间。
-
优点: 更适合长文、摘要、长对话任务。
-
多尺度评估策略:
-
算法内部在 token 级计算 saliency / attribution;
-
然后把 token 分数按分组聚合(sum / mean / max)成 word / chunk 分数;
-
所有评估指标(AUC)在不同尺度上都算一份。
这样:模型方可以说“我们是真的在 token level faithful”;人类方看的是更易读的 word/chunk heatmap。
总结与展望
这份调研清晰地展现了归因领域的三大趋势:
-
从 NLU 到 NLG: 研究重心从 ERASER 所代表的分类模型转向了 ReAGent 所针对的生成模型。
-
从“硬”扰动到“软”扰动: 社区认识到,简单地删除词元(硬擦除)会产生 OOD 输入,从而误导评估。无论是评估指标(Soft-NS/NC)还是归因方法本身(ReAGent 的替换策略),都在向更“平滑”、更“符合分布”的扰动方式发展。
未来工作将集中于更好地处理生成任务的特殊性,包括高方差的采样解码、多模态正确输出,以及长上下文中的非局部效应。