两步法将加权机制提示融入 LLM-as-a-Judge:案例研究
计算与语言
2025-02-20 v1
摘要
尽管大语言模型(LLM)已成为评估自然语言生成(NLG)任务的有前景的工具,但其有效性受限于无法适当地权衡不同主题的重要性,往往过度强调次要细节而低估关键信息,从而导致误导性的评估。我们的工作提出了一种高效的提示设计机制以解决这一特定局限性,并提供了一个案例研究。通过结合显式重要性加权机制的战略性提示工程,我们增强了 LLM-as-a-Judge 有效优先处理相关信息的能力,这在人类对齐率(HAR)指标上平均提升了 6% 得到了证明。
引用
@article{arxiv.2502.13396,
title = {Prompting a Weighting Mechanism into LLM-as-a-Judge in Two-Step: A Case Study},
author = {Wenwen Xie and Gray Gwizdz and Dongji Feng},
journal= {arXiv preprint arXiv:2502.13396},
year = {2025}
}
备注
5 pages, 5 tables, 1 figure