中文

思维链不忠实度作为伪装的准确率

计算与语言 2024-06-24 v3 人工智能 机器学习

摘要

理解思维链(CoT)生成与大型语言模型(LLM)内部计算的一致程度,对于决定是否信任LLM的输出至关重要。作为CoT忠实度的代理指标,Lanham等人(2023)提出了一种度量模型在产生答案时对其CoT依赖程度的指标。在单一专有模型系列中,他们发现LLM在模型大小与其忠实度度量之间表现出先缩放后逆缩放的关系,并且一个130亿参数的模型相比从8.1亿到1750亿参数的模型表现出更高的忠实度。我们评估这些结果是否泛化为所有LLM的属性。我们复制了他们论文中专注于缩放实验的实验设置,使用三个不同的模型系列,并在特定条件下成功复现了他们报告的CoT忠实度的缩放趋势。然而,在归一化指标以考虑模型对某些答案选择的偏差后,较小且能力较弱的模型的不忠实度显著下降。这个归一化的忠实度指标也与准确率强相关(R²=0.74),这对其评估忠实度的有效性提出了质疑。

关键词

引用

@article{arxiv.2402.14897,
  title  = {Chain-of-Thought Unfaithfulness as Disguised Accuracy},
  author = {Oliver Bentham and Nathan Stringham and Ana Marasović},
  journal= {arXiv preprint arXiv:2402.14897},
  year   = {2024}
}

备注

TMLR accepted paper camera-ready version. First two authors contributed equally. 8 pages main, 13 pages appendix