面向问答的指令跟随模型正确性与忠实性评估
计算与语言
2024-04-18 v2 人工智能
摘要
检索增强的指令跟随模型是微调方法在信息寻求任务(如问答 QA)中有吸引力的替代方案。通过仅在输入前附加检索文档与指令,这些模型无需额外微调即可适配各种信息域与任务。虽然模型响应往往自然流畅,但额外的冗长使传统 QA 评估指标(如精确匹配 EM 和 F1)无法可靠准确量化模型性能。本工作中,我们考察指令跟随模型在三项信息寻求 QA 任务上的表现。我们采用自动与人工评估,从两个维度评价这些模型:1)满足用户信息需求的程度(正确性);2)是否基于所提供知识生成响应(忠实性)。在人工评估与分析指导下,我们凸显传统指标在正确性与忠实性上的缺陷,随后提出反映这些模型真实表现的基于简单词元重叠与基于模型的指标。分析揭示指令跟随模型具竞争力,有时在正确性上甚至优于微调模型;但这些模型难以恪守所提供知识,常于响应中幻觉。我们希望本工作促进对 QA 指令跟随模型更整体的评估。代码与数据见 https://github.com/McGill-NLP/instruct-qa
引用
@article{arxiv.2307.16877,
title = {Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answering},
author = {Vaibhav Adlakha and Parishad BehnamGhader and Xing Han Lu and Nicholas Meade and Siva Reddy},
journal= {arXiv preprint arXiv:2307.16877},
year = {2024}
}
备注
accepted at TACL