X-Eval:通过带辅助评估维度的增强指令微调实现可泛化的多方面文本评估
计算与语言
2024-04-16 v2 人工智能
机器学习
摘要
自然语言生成(NLG)通常涉及从多个方面(如一致性和自然度)评估生成文本以获得全面评价。然而,多方面评估仍具挑战性,因为它可能要求评估器泛化到任意给定的评估维度,即使该维度在训练时未出现。本文介绍 X-Eval,一种两阶段指令微调框架,用于评估由终端用户定制的已见和未见方面的文本。X-Eval 包含两个学习阶段:提升模型遵循评估指令能力的普通指令微调阶段,以及利用细粒度评估维度间联系以更好评估文本质量的增强指令微调阶段。为支持 X-Eval 训练,我们收集了 AspectInstruct,首个面向多方面 NLG 评估的指令微调数据集,涵盖 27 个多样化评估维度与 65 项任务。为增强任务多样性,我们设计了一种增强策略,将人类评分标注转换为多种形式的 NLG 评估任务,包括打分、比较、排序和布尔问答。在对话生成、摘要和数据到文本三类关键 NLG 任务及元评估中 21 个维度上的大量实验表明,我们的 X-Eval 使即便是轻量级语言模型也能达到与最先进 NLG 评估器(如 GPT-4)相当甚至更高的与人类判断的相关性。
引用
@article{arxiv.2311.08788,
title = {X-Eval: Generalizable Multi-aspect Text Evaluation via Augmented Instruction Tuning with Auxiliary Evaluation Aspects},
author = {Minqian Liu and Ying Shen and Zhiyang Xu and Yixin Cao and Eunah Cho and Vaibhav Kumar and Reza Ghanadan and Lifu Huang},
journal= {arXiv preprint arXiv:2311.08788},
year = {2024}
}
备注
NAACL 2024 Main Conference. 20 pages, 6 figures, 17 tables