中文

OSCToM:基于强化学习的对抗性高阶心智理论生成

人工智能 2026-05-21 v1

摘要

大型语言模型(LLM)在许多语言任务中表现良好,但其在复杂社交情境下的心智理论(ToM)推理仍不均衡。现有基准,包括ExploreToM,不总是测试那些使这些情境变得困难的递归信念和信息不对称。本文提出OSCToM(观察者-自我冲突心智理论),一种用于建模LLM基于ToM任务中嵌套信念冲突的方法。关键案例是观察者对另一智能体的视图与观察者自身信念状态之间的冲突。此类案例超越了简单的视角转换,需要递归的、多层次的推理。OSCToM结合了强化学习(RL)、扩展的领域特定语言和组合代理模型,用于生成观察者-自我冲突。在我们的实验中,OSCToM-8B是在所测试系统中表现最好的结果。它在FANToM和Hi-ToM和BigToM上的结果优于报告的ExploreToM结果。在信息不对称的FANToM基准上,OSCToM达到了76%的准确率,而ExploreToM仅报告了0.2%。数据合成程序也更有效率了6倍,表明有针对性的训练数据可以帮助较小的模型处理更先进的认知推理。项目代码可在https://github.com/sharminsrishty/osct获得。

关键词

引用

@article{arxiv.2605.20423,
  title  = {OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind},
  author = {Sharmin Sultana Srishty and Kazi Mahathir Rahman and Malaika Parizat Sakkhi and Samia Shahid Prianna and Shaikhul Islam Sinat},
  journal= {arXiv preprint arXiv:2605.20423},
  year   = {2026}
}

备注

15 pages, 12 figures containing 15 images, 3 tables. Code available at https://github.com/sharminsrishty/osct