Rate, Explain and Cite (REC):大语言模型自动评估中的增强解释与归因
计算与语言
2025-05-21 v3 人工智能
摘要
大语言模型在生成连贯高质量文本方面展现出惊人的能力,因而在广泛的文本生成任务中具有重要价值。然而,对生成内容的严格评估至关重要,因为确保其质量仍是一个重大挑战,由于持续存在的事实性错误和幻觉等问题。本文引入了三个经过微调的通用大语言模型自动评估器 REC-8B、REC-12B 和 REC-70B,专为评估生成文本的多个维度:忠实性、指令遵循、连贯性和完整性。这些模型不仅提供这些指标的评分,还提供详细的解释和可验证的引用,从而增强了内容的可信度。此外,模型支持多种引用模式,以满足不同的延迟和细粒度要求。广泛的评估表明,我们的通用大语言模型自动评估器 REC-70B 在内容评估方面超越了最先进的大语言模型,凭借更高质量的解释和引用以及最小的偏见,实现了卓越的表现。我们的 REC 数据集和模型已在 https://github.com/adelaidehsu/REC 上提供。
引用
@article{arxiv.2411.02448,
title = {Rate, Explain and Cite (REC): Enhanced Explanation and Attribution in Automatic Evaluation by Large Language Models},
author = {Aliyah R. Hsu and James Zhu and Zhichao Wang and Bin Bi and Shubham Mehrotra and Shiva K. Pentyala and Katherine Tan and Xiang-Bo Mao and Roshanak Omrani and Sougata Chaudhuri and Regunathan Radhakrishnan and Sitaram Asur and Claire Na Cheng and Bin Yu},
journal= {arXiv preprint arXiv:2411.02448},
year = {2025}
}