变异性无需等同于错误:充分但语义不同的响应之案例
计算与语言
2024-12-23 v1
摘要
随着语言模型 (LM) 的广泛应用,估计其对提示作出可靠响应能力的需求日益增长(例如,生成的响应是否可能是正确的?)。不确定性量化工具(如置信度和熵等)可用于此目的(例如,当模型“不确定”时,可拒绝响应)。例如,Kuhn 等人(语义熵;2022b)将样本响应之间的语义变异性视为模型“困扰”于该提示的证据,表明 LM 可能出错。我们认为,语义变异性无需等同于错误——这在开放式情境中尤其直观,在此类情境中,提示会引发多个充分但语义上不同的响应。因此,我们提出对样本响应进行足够性标注(例如,使用分类器),并估计模型分配给足够响应的概率 (PROBAR),据此我们将其视为模型在实例级别可靠性的指示器。我们在两个 QA 数据集和 next-word 预测任务(针对英文)上评估 PROBAR 作为选择性预测中置信度的度量,发现 PROBAR 在不同程度模糊性/开放性提示下均优于语义熵。
引用
@article{arxiv.2412.15683,
title = {Variability Need Not Imply Error: The Case of Adequate but Semantically Distinct Responses},
author = {Evgenia Ilia and Wilker Aziz},
journal= {arXiv preprint arXiv:2412.15683},
year = {2024}
}
备注
26 pages