中文

基于大语言模型的评测器是多语言评测规模化的解决方案吗?

高能天体物理现象 2023-09-28 v2

摘要

大语言模型(LLMs)在各种自然语言处理(NLP)任务中表现出色,然而其评测,尤其在排名前 2020 以外的语言中,因现有基准与指标的局限仍不充分。采用 LLM 作为评测器对其他模型输出排序或打分,成为应对人类标注者与既定基准限制的可行方案。本研究探索基于 LLM 的评测器(特别是 GPT-4)通过针对三个文本生成任务、五种指标与八种语言的 2020K 人类判断进行校准,在增强多语言评测方面的潜力。我们的分析揭示基于 GPT-4 的评测器偏向更高分数,凸显以母语者判断进行校准的必要性,尤其在低资源与非拉丁字母语言中,以确保跨多样语言对 LLM 性能的准确评测。

关键词

引用

@article{arxiv.2309.07463,
  title  = {Bridging between type IIb and Ib supernovae: SN IIb 2022crv with a very thin Hydrogen envelope},
  author = {Anjasha Gangopadhyay and Keiichi Maeda and Avinash Singh and Nayana A. J. and Tatsuya Nakaoka and Koji S Kawabata and Kenta Taguchi and Mridweeka Singh and Poonam Chandra and Stuart D Ryder and Raya Dastidar and Masayuki Yamanaka and Miho Kawabata and Rami Z. E. Alsaberi and Naveen Dukiya and Rishabh Singh Teja and Bhavya Ailawadhi and Anirban Dutta and D. K. Sahu and Takashi J Moriya and Kuntal Misra and Masaomi Tanaka and Roger Chevalier and Nozomu Tominaga and Kohki Uno and Ryo Imazawa and Taisei Hamada and Tomoya Hori and Keisuke Isoga},
  journal= {arXiv preprint arXiv:2309.07463},
  year   = {2023}
}

备注

The paper contains 20 figures and 9 tables. Accepted for publication in The Astrophysical Journal (ApJ)