真相还是扭曲?基于 LLM 对抗情境生成中可靠标签翻转评估的最优模型选择
计算与语言
2025-08-28 v3
摘要
对抗情境示例在通过对抗情境数据增强 (CDA) 提升大语言模型 (LLM) 的性能和鲁棒性方面发挥着广泛作用。然而,用来评估生成对抗情境标签翻转的评判模型选择,作为衡量 CDA 生成对抗情境有效性的主要指标,导致结果不一致。为破解此问题,我们定义了生成模型与评判模型之间四种关系类型:即为同一模型、属于同一模型家族、为独立模型,以及具有蒸馏关系。通过涉及两项最先进 LLM 方法、三个数据集、四个生成模型和 15 个评判模型的大量实验,结合用户研究 (n=90),我们证明了与生成模型具有独立且未微调关系的评判模型提供了最可靠的标签翻转评估。生成模型与评判模型之间的关系与 CDA 的用户研究 closely aligned,结果表明模型性能和鲁棒性更佳。然而,我们发现最有效评判模型的结果与用户研究结果之间仍存在较大差距。这表明 CDA 的完全自动化管道可能不够,需要人工干预。
引用
@article{arxiv.2505.13972,
title = {Truth or Twist? Optimal Model Selection for Reliable Label Flipping Evaluation in LLM-based Counterfactuals},
author = {Qianli Wang and Van Bach Nguyen and Nils Feldhus and Luis Felipe Villa-Arenas and Christin Seifert and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2505.13972},
year = {2025}
}
备注
Accepted at INLG 2025, camera-ready version