中文

穿针引线:重织思维链推理以解释人类标注变异

计算与语言 2025-09-25 v3

摘要

近期推理微调大语言模型(LLM)的兴起——即在给出最终答案前生成思维链——引起了广泛关注,并为深入理解人类标注变异提供了新机遇。人类标注变异是指多名标注者对同一数据实例进行标注时产生的合理差异。先前的研究表明,LLM 生成的解释有助于使模型预测与人类标注分布对齐,但通常采用一种逆向范式:基于给定答案生成解释。相比之下,CoT 提供了一条前向推理路径,在生成答案之前,可能隐式地嵌入了每个答案选项的依据。因此,我们提出了一种基于 LLM 的新型流水线, enriched with 语言学基础的语篇分割器,以更高的精度从 CoT 中提取每个答案选项的支持与反对陈述。我们还提出了一种基于排序的 HLV 评估框架,该框架优先考虑答案的排序而非精确分数,从而更有利于标注分布的直接比较。我们的方法在三个数据集上优于直接生成方法和基线方法,并表明排序方法与人类的一致性更好,突显了我们方法的有效性。

关键词

引用

@article{arxiv.2505.23368,
  title  = {Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation},
  author = {Beiduo Chen and Yang Janet Liu and Anna Korhonen and Barbara Plank},
  journal= {arXiv preprint arXiv:2505.23368},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 Main (Oral), 25 pages, 7 figures