FamiCom:通过任务无关性能估计进一步揭秘语言模型的提示
计算与语言
2024-06-18 v1 人工智能
摘要
语言模型展现了令人印象深刻的上下文学习能力,这使它们能够从输入提示中受益,并在下游最终任务上表现更好。现有工作研究了这一现象背后的机制,并提出了与标签无关的提示度量,可以更好地估计最终任务性能。一种流行的方法是使用困惑度来衡量模型对提示的熟悉程度。虽然在领域内任务上表现出一致的改进,但我们发现,像困惑度这样的熟悉度度量无法在复杂情况下(例如任务或领域迁移场景)准确估计性能。在这项工作中,我们提出了一种修订后的度量,称为FamiCom,为任务无关的性能估计提供了更全面的度量。具体来说,FamiCom将熟悉度与\textit{复杂度}(最终任务的内在难度)相结合,这是当前度量中缺失的一个重要因素。实验表明,FamiCom与最终任务性能高度相关,产生了0.85的斯皮尔曼相关系数,而仅使用熟悉度的度量则为0.43。我们进一步将FamiCom应用于自动提示和演示选择,在准确率上比现有方法和基线高出7.0%以上。
引用
@article{arxiv.2406.11243,
title = {FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation},
author = {Bangzheng Li and Ben Zhou and Xingyu Fu and Fei Wang and Dan Roth and Muhao Chen},
journal= {arXiv preprint arXiv:2406.11243},
year = {2024}
}