CLEV:基于轻量高效投票的 LLM 自由形式问答评估
计算与语言
2025-11-12 v2 人工智能
摘要
评估自由形式问答(QA) remains a challenge due to its diverse and open-ended nature。传统自动度量未能捕捉语义等价性或容纳开放式响应的多样性。利用大语言模型(LLM)作为评估者提供了有前景的替代方案,due to their strong language understanding and instruction-following capabilities. 我们提出了通过轻量高效投票实现共识(Consensus via Lightweight Efficient Voting,CLEV),该方法使用两个主要 LLM 作为评判官,仅在不同步时调用第三个评判官。该方法在保证评估可靠性的同时,减少了不必要的计算需求。通过实验,包括人类评估,我们展示了 CLEV 能够提供一致、可扩展且资源高效的评估,建立了它作为评估 LLM 在自由形式 QA 方面强大框架。
引用
@article{arxiv.2503.08542,
title = {CLEV: LLM-Based Evaluation Through Lightweight Efficient Voting for Free-Form Question-Answering},
author = {Sher Badshah and Moamen Moustafa and Hassan Sajjad},
journal= {arXiv preprint arXiv:2503.08542},
year = {2025}
}
备注
Accepted to AACL 2025