中文

谨慎验证:依赖不完美事实性指标的陷阱

计算与语言 2025-01-31 v2 机器学习

摘要

大型语言模型的改进导致人们日益乐观,认为它们可以作为自然语言生成输出的可靠评估器。本文通过彻底重新评估五个最先进的事实性指标,这些指标在汇集的 11 个数据集上用于摘要、检索增强生成和问答任务。我们发现,这些评估器彼此之间不一致,常常误估系统级性能,这些都可能导致各种陷阱。我们进一步表明,这些指标对高度改写输出以及依赖远离源文档部分的输出存在偏见。我们呼吁使用这些事实性指标的用户谨慎使用,并在其感兴趣的领域中手动验证这些指标的可靠性。

关键词

引用

@article{arxiv.2501.14883,
  title  = {Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metrics},
  author = {Ameya Godbole and Robin Jia},
  journal= {arXiv preprint arXiv:2501.14883},
  year   = {2025}
}

备注

v2: Added Acknowledgements to funding sources and advisors