DCR-Consistency:用于大语言模型一致性评估与改进的分治推理方法
计算与语言
2024-01-05 v1 人工智能
摘要
评估大语言模型(LLM)生成文本的质量与变异性是一项重大且尚未解决的研究挑战。传统的评估方法(如 ROUGE 和 BERTScore)通过测量词元相似度,往往无法捕捉整体的语义等价性。这导致其与人类判断和直觉的相关性较低,在医疗和金融等高度依赖可靠性、安全性与稳健决策的高风险应用中尤为不利。本研究提出 DCR,一个使用分治推理(divide-conquer-reasoning)方法评估并改进 LLM 生成文本一致性的自动化框架。与现有在段落级别操作的基于 LLM 的评估器不同,我们的方法采用分治评估器(DCE),将两个生成响应之间的段落对段落比较分解为多个句子对段落的比较,并根据预定义标准对每个比较进行评估。为实现该方法,我们引入了自动度量转换器(AMC),将 DCE 的输出转换为可解释的数值分数。除一致性评估外,我们进一步提出了原因辅助改进器(RAI),利用 DCE 识别出的带解释的分析原因生成新响应,以减少这些不一致性。通过全面且系统的实证分析,我们表明在语义、事实和摘要一致性任务中,我们的方法在多个基准测试上评估 LLM 生成的一致性时,大幅优于现有方法(例如,在 SummEval 数据集上分别提升 +19.3% 和 +24.3%)。该方法还大幅减少了近 90% 的输出不一致性,展现出有效缓解幻觉的潜力。
引用
@article{arxiv.2401.02132,
title = {DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and Improvement of Large Language Models},
author = {Wendi Cui and Jiaxin Zhang and Zhuohang Li and Lopez Damien and Kamalika Das and Bradley Malin and Sricharan Kumar},
journal= {arXiv preprint arXiv:2401.02132},
year = {2024}
}