CFMatch:面向开放领域问答的自动化答案等价性评估与专家判断对齐
计算与语言
2024-07-02 v4
摘要
问答(QA)只有在知道答案是否正确时才能取得进展,但对于许多最具挑战性和趣味性的 QA 实例,当前用于确定答案等价性(AE)的评估指标通常与人类判断不一致,尤其是来自大型语言模型(LLM)的更冗长的自由形式答案。这面临两个挑战:缺乏数据以及模型过大:基于 LLM 的评分器可以与人类评判者更好地相关联,但该任务仅在有限的 QA 数据集上进行了测试,且即使可用,由于 LLM 规模庞大且通常成本高昂,模型的更新也受到限制。我们通过提供源自专业人类 QA 比赛的清晰且一致的机器 QA 中 AE 评估指南来解决这两个问题。我们还引入了标准评估与一种更高效、鲁棒且轻量级的判别式 AE 分类器匹配方法(CFMatch,小于 1 MB)的组合,该方法经过训练和验证,能够根据所采用的专家 AE 规则更准确地评估答案正确性,且更符合人类判断。
引用
@article{arxiv.2401.13170,
title = {CFMatch: Aligning Automated Answer Equivalence Evaluation with Expert Judgments For Open-Domain Question Answering},
author = {Zongxia Li and Ishani Mondal and Yijun Liang and Huy Nghiem and Jordan Boyd-Graber},
journal= {arXiv preprint arXiv:2401.13170},
year = {2024}
}
备注
A duplicate and polished version is in arXiv:2402.11161