OCEAN:大型语言模型的离线思维链评估与对齐
机器学习
2024-11-01 v1 计算与语言
摘要
大型语言模型(LLM)的离线评估对于理解其能力至关重要,但现有研究中的方法仍探索不足。在这项工作中,我们专注于思维链能力的离线评估,并展示如何基于所提出的评估方法优化LLM。为了提供具有丰富知识和推理路径的离线反馈,我们使用知识图谱(例如Wikidata5m)为生成的思维链提供反馈。由于LLM推理与知识图谱结构之间的异构性,知识图谱对LLM行为的直接交互和反馈具有挑战性,因为这需要将LLM生成的思维链准确地进行实体链接并锚定在知识图谱中。为了解决上述挑战,我们提出了一个离线思维链评估框架OCEAN,该框架将LLM中的思维链推理建模为马尔可夫决策过程(MDP),并评估策略与知识图谱偏好建模的对齐程度。为了克服推理异构性和锚定问题,我们利用在线策略知识图谱探索和强化学习(RL)来建模一个知识图谱策略,该策略为LLM生成的思维链推理路径生成词元级似然分布,模拟知识图谱的推理偏好。然后,我们将关于生成推理路径有效性和对齐性的知识图谱反馈纳入逆倾向评分,并提出KG-IPS估计器。理论上,我们证明了所提出的KG-IPS估计器的无偏性,并给出了其方差的下界。利用离线策略评估的值函数,我们可以直接进行离线策略优化,以进一步增强思维链的对齐性。我们的实证研究表明,OCEAN可以被高效优化,以生成具有更高估计值的思维链推理路径,同时不影响LLM在下游任务中的通用能力或其内部知识。
引用
@article{arxiv.2410.23703,
title = {OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models},
author = {Junda Wu and Xintong Li and Ruoyu Wang and Yu Xia and Yuxin Xiong and Jianing Wang and Tong Yu and Xiang Chen and Branislav Kveton and Lina Yao and Jingbo Shang and Julian McAuley},
journal= {arXiv preprint arXiv:2410.23703},
year = {2024}
}
备注
10 pages