中文

探究情境链与参数链在优化下的相互作用

计算与语言 2026-05-26 v1 人工智能 机器学习

摘要

链式思维(Chain-of-Thought,CoT)忠诚度,即链式思维是否真实反映大型语言模型(LLM)的底层行为,通常在两个互斥的范式下进行评估:情境忠诚度通过扰动输入或CoT轨迹来衡量,参数忠诚度通过干预模型的参数知识来评估。然而,现有工作仅进行描述性比较。我们填补这一空白,提出FaithMate,一种统一的偏好对齐界面,用于优化模型以实现上述两种忠诚度范式之一。它使我们能够探讨两种范式之间的相互作用,检验忠诚度提升是否在同一范式内以及跨范式间普遍化。我们在三个模型、两个数据集和六个忠诚度指标上发现,两种范式呈正相关,但存在不对称性:针对参数忠诚度的优化在两种范式中均实现稳定的提升,而情境范式的提升则更为不稳定。在情境范式内部,不同忠诚度指标上的提升并不一致地传递到其他指标,这表明现有的情境指标捕捉的忠诚度不同方面,并暴露了内在的权衡。这些发现表明,CoT忠诚度并非单一目标,因此需要多层次的优化和评估。

关键词

引用

@article{arxiv.2605.24960,
  title  = {Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization},
  author = {Jingyi Sun and Qianli Wang and Pepa Atanasova and Nils Feldhus and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2605.24960},
  year   = {2026}
}

备注

The first two authors contributed equally and share first-authorship