评估开放问答评估
计算与语言
2023-10-24 v4 人工智能
摘要
本研究关注开放问答(Open-QA)任务的评估,该任务可以直接估计大型语言模型(LLMs)的事实性。当前的自动评估方法显示出局限性,表明人工评估仍然是最可靠的方法。我们引入一个新任务,评估问答评估(QA-Eval)以及相应的数据集EVOUNA,旨在评估AI生成的答案相对于开放问答中标准答案的准确性。我们利用人工标注的结果来评估这些方法的性能。具体地,工作研究了与人工评估高度相关的方法,认为它们更可靠。我们还讨论了当前方法的缺陷以及改进基于LLM的评估器的方法。我们相信这个新的QA-Eval任务和相应的数据集EVOUNA将促进更有效的自动评估工具的开发,并对该领域的未来研究有价值。所有资源可在\url{https://github.com/wangcunxiang/QA-Eval}获取,采用Apache-2.0许可证。
引用
@article{arxiv.2305.12421,
title = {Evaluating Open-QA Evaluation},
author = {Cunxiang Wang and Sirui Cheng and Qipeng Guo and Yuanhao Yue and Bowen Ding and Zhikun Xu and Yidong Wang and Xiangkun Hu and Zheng Zhang and Yue Zhang},
journal= {arXiv preprint arXiv:2305.12421},
year = {2023}
}
备注
Accepted by Neurips-2023 Datasets and Benchmarks track; 28 pages