不要贪婪,三思而行:文档级信息抽取的采样与选择
计算与语言
2026-05-29 v2
摘要
文档级信息抽取(DocIE)旨在生成一个输出模板,其中包含给定文档中出现的感兴趣的实体、关系和事件。标准做法包括使用贪婪解码来提示仅解码器 LLM,以避免输出的可变性。我们不将这种可变性视为一种限制,而是表明采样可以产生比贪婪解码好得多的解决方案,尤其是在使用推理模型时。因此,我们提出了 ThinkTwice,一个采样和选择框架,其中 LLM 为给定文档生成多个候选模板,并由一个选择模块选择最合适的一个。我们引入了一种利用生成输出间一致性的无监督方法,以及一种使用在标注 DocIE 数据上训练的奖励模型的有监督选择方法。为了解决 DocIE 缺乏黄金推理轨迹的问题,我们提出了一种基于拒绝采样的方法来生成银牌训练数据,将输出模板与推理轨迹配对。我们的实验证明了无监督和有监督 ThinkTwice 的有效性,持续优于贪婪基线和有监督的最先进方法。
引用
@article{arxiv.2601.18395,
title = {Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction},
author = {Mikel Zubillaga and Oscar Sainz and Oier Lopez de Lacalle and Eneko Agirre},
journal= {arXiv preprint arXiv:2601.18395},
year = {2026}
}
备注
Submitted to EMNLP 2026