NTCIR-18 AEOLLM 任务的 PanguIR 技术报告
计算与语言
2025-03-11 v2 人工智能
摘要
随着大型语言模型(LLM)在学术界和产业界的广泛关注,有效评估其能力日益关键且具挑战性。现有评估方法可大致分为两类:人工评估和自动评估。人工评估虽然全面,但往往代价高昂且资源密集;而自动评估则因评估标准受限(以参考答案为主)而受到约束。为此,NTCIR-18 引入了 AEOLLM(Automatic Evaluation of LLMs)任务,旨在鼓励克服现有方法局限性的无参考评估方法。本文为提升 AEOLLM 任务的评估性能,提出三项关键方法:1)多模型协作:利用多个 LLM 跨越各子任务以模拟人类评分;2)提示自动优化:利用 LLM 根据训练样本的评估反馈迭代细化初始任务提示;3)基于情境学习(ICL)优化:基于多任务评估反馈,训练专门的情境示例检索模型,结合语义相关性检索模型,联合识别最有效的情境学习示例。在最终数据集上的实验表明,我们的方法在 AEOLLM 任务上取得优异性能。
引用
@article{arxiv.2503.04809,
title = {PanguIR Technical Report for NTCIR-18 AEOLLM Task},
author = {Lang Mei and Chong Chen and Jiaxin Mao},
journal= {arXiv preprint arXiv:2503.04809},
year = {2025}
}