模拟人类考官评分:面向长回答生成任务的加权重要性多点评估框架
计算与语言
2026-04-15 v2
摘要
评估生成式任务中模型回答质量 remains a 挑战,因为预期答案通常包含多个在语义上独立且互补的因素,需要进行因子化以进行细粒度评估。最近的评估方法依赖于任务级别的评分标准或基于问题的检查表,但仍面临 1)难以评估回答是否真正基于提供的上下文;2)无法捕捉不同方面在参考答案中的异构重要性。鼓励人类考官的做法,我们提出了加权重要性多点评估(WIMPE)框架,将每个参考答案分解为加权的、以上下文为依据的评分点。设计了两个互补的指标,即加权点对齐(WPA)和点冲突惩罚(PCP),用于衡量模型回答与参考答案之间的对齐程度和矛盾程度。在 10 个生成式任务上的大量实验表明,WIMPE 与人类标注的相关性更高。
引用
@article{arxiv.2604.11246,
title = {Judge Like Human Examiners: A Weighted Importance Multi-Point Evaluation Framework for Generative Tasks with Long-form Answers},
author = {Guoxin Yu and Chulun Zhou and Lemao Liu and Qi Wang and Mo Yu and Jialong Tang and Baosong Yang and Xiang Ao and Wai Lam and Yue Yu},
journal= {arXiv preprint arXiv:2604.11246},
year = {2026}
}
备注
21 pages