小型编码器在检测答案可支撑性方面可与大型解码器媲美
计算与语言
2025-06-27 v1 人工智能
信息检索
机器学习
摘要
用外部上下文增强大型语言模型(LLM)可显著提升其在自然语言处理(NLP)任务中的性能。然而,当提供的上下文缺乏信息时,LLM 难以可靠地回答查询,常常诉诸于无根据的推测或内部知识。答案可支撑性——即生成的响应严格由上下文支持——对于确保事实一致性和可信度至关重要。本研究聚焦于在 LLM 进行昂贵的答案生成之前,检测给定查询是否在所提供的文档上下文中得到支撑。这种检测机制可以显著减少推理时间和资源消耗。我们表明,轻量级的、针对特定任务的编码器模型(如 RoBERTa 和 NomicBERT),在经过精心策划的数据集上微调后,在答案可支撑性检测方面可以达到与最先进的 LLM(如 Llama3 8B 和 GPT4o)相当的准确率,同时将推理延迟降低数个数量级。代码可在 https://github.com/chandarlab/Hallucinate-less 获取。
引用
@article{arxiv.2506.21288,
title = {Small Encoders Can Rival Large Decoders in Detecting Groundedness},
author = {Istabrak Abbes and Gabriele Prato and Quentin Fournier and Fernando Rodriguez and Alaa Boukhary and Adam Elwood and Sarath Chandar},
journal= {arXiv preprint arXiv:2506.21288},
year = {2025}
}