中文

小型编码器在检测答案可支撑性方面可与大型解码器媲美

计算与语言 2025-06-27 v1 人工智能 信息检索 机器学习

摘要

用外部上下文增强大型语言模型(LLM)可显著提升其在自然语言处理(NLP)任务中的性能。然而,当提供的上下文缺乏信息时,LLM 难以可靠地回答查询,常常诉诸于无根据的推测或内部知识。答案可支撑性——即生成的响应严格由上下文支持——对于确保事实一致性和可信度至关重要。本研究聚焦于在 LLM 进行昂贵的答案生成之前,检测给定查询是否在所提供的文档上下文中得到支撑。这种检测机制可以显著减少推理时间和资源消耗。我们表明,轻量级的、针对特定任务的编码器模型(如 RoBERTa 和 NomicBERT),在经过精心策划的数据集上微调后,在答案可支撑性检测方面可以达到与最先进的 LLM(如 Llama3 8B 和 GPT4o)相当的准确率,同时将推理延迟降低数个数量级。代码可在 https://github.com/chandarlab/Hallucinate-less 获取。

关键词

引用

@article{arxiv.2506.21288,
  title  = {Small Encoders Can Rival Large Decoders in Detecting Groundedness},
  author = {Istabrak Abbes and Gabriele Prato and Quentin Fournier and Fernando Rodriguez and Alaa Boukhary and Adam Elwood and Sarath Chandar},
  journal= {arXiv preprint arXiv:2506.21288},
  year   = {2025}
}