ConSens:评估开放书籍问答中的上下文 grounding
计算与语言
2025-05-02 v1 机器学习
摘要
大语言模型(LLM)在开放书籍问答(QA)中展现出显著的成功,任务要求生成基于提供的外部上下文 grounding 的答案。在开放书籍QA中,一个关键挑战是确保模型响应基于提供的上下文,而非其参数化知识(可能已过时、不完整或错误)。现有评估方法主要基于LLM-as-a-judge方法,面临偏见、可扩展性问题以及依赖高成本外部系统的限制。为解决这些挑战,我们提出了一种新型指标,通过对比模型响应在两种条件下的 perplexity:即提供上下文和不提供上下文时的情感。该评分量化了模型答案依赖于提供上下文的程度。通过一系列实验证明了该指标在识别给定答案是否基于提供上下文方面的有效性。与现有方法不同,本指标计算高效、可解释且适用于各种用例,为评估开放书籍QA系统中的上下文利用提供了可扩展且实用的解决方案。
引用
@article{arxiv.2505.00065,
title = {ConSens: Assessing context grounding in open-book question answering},
author = {Ivan Vankov and Matyo Ivanov and Adriana Correia and Victor Botev},
journal= {arXiv preprint arXiv:2505.00065},
year = {2025}
}
备注
9 pages, 3 figures, 3 tables