中文

更精细的引用总是更好吗?重新思考属性生成中的粒度

计算与语言 2026-04-06 v2

摘要

引用粒度——是引用单个句子、段落还是文档——是属性生成中的关键设计选择。虽然细粒度引用通常因便于人工验证而受到青睐,但其对模型性能的影响仍未被充分探索。我们分析了四种模型规模(8B-120B),并证明强制细粒度引用会使归因质量相比最优粒度下降 16-276%。我们观察到一种一致的性能模式,即归因质量在中间粒度(段落级)处达到峰值。我们的分析表明,细粒度(句子级)引用会破坏将证据归因于回答主张所需的语义依赖,而过度粗糙的引用(多段落)则会引入干扰噪声。重要的是,这一性能差距的幅度随模型规模非单调变化:细粒度约束不成比例地惩罚更大的模型,表明原子引用单元破坏了这些模型擅长的多句信息综合。值得注意的是,最优引用粒度在保持甚至提升回答正确性的同时,显著提升了归因质量。总体而言,我们的发现表明,仅通过细粒度引用优化人工验证会忽视模型约束,损害归因忠实性和生成可靠性。相反,有效的属性生成需要将引用粒度与模型的自然语义范围对齐。

关键词

引用

@article{arxiv.2604.01432,
  title  = {Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation},
  author = {Hexuan Wang and Jingyu Zhang and Benjamin Van Durme and Daniel Khashabi},
  journal= {arXiv preprint arXiv:2604.01432},
  year   = {2026}
}