中文

不要贪婪,三思而行:文档级信息抽取的采样与选择

计算与语言 2026-05-29 v2

摘要

文档级信息抽取(DocIE)旨在生成一个输出模板,其中包含给定文档中出现的感兴趣的实体、关系和事件。标准做法包括使用贪婪解码来提示仅解码器 LLM,以避免输出的可变性。我们不将这种可变性视为一种限制,而是表明采样可以产生比贪婪解码好得多的解决方案,尤其是在使用推理模型时。因此,我们提出了 ThinkTwice,一个采样和选择框架,其中 LLM 为给定文档生成多个候选模板,并由一个选择模块选择最合适的一个。我们引入了一种利用生成输出间一致性的无监督方法,以及一种使用在标注 DocIE 数据上训练的奖励模型的有监督选择方法。为了解决 DocIE 缺乏黄金推理轨迹的问题,我们提出了一种基于拒绝采样的方法来生成银牌训练数据,将输出模板与推理轨迹配对。我们的实验证明了无监督和有监督 ThinkTwice 的有效性,持续优于贪婪基线和有监督的最先进方法。

关键词

引用

@article{arxiv.2601.18395,
  title  = {Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction},
  author = {Mikel Zubillaga and Oscar Sainz and Oier Lopez de Lacalle and Eneko Agirre},
  journal= {arXiv preprint arXiv:2601.18395},
  year   = {2026}
}

备注

Submitted to EMNLP 2026