语言模型是理性的吗?——一致性规范与信念修正的案例
计算与语言
2025-11-17 v3 人工智能
摘要
理性规范是否适用于机器学习模型,特别是语言模型?本文通过聚焦于理性规范的一个特殊子集——一致性规范来研究这一问题。我们既考虑逻辑一致性规范,也考虑与信念强度相关的一致性规范。为了理解后者,我们引入了最小同意连接(MAC),并提出了一种新的置信度解释,该解释仅基于模型内部的下一个词概率来统一分配信念强度。我们认为,与一致性相关的理性规范确实适用于某些语言模型,但不适用于其他模型。这一问题意义重大,因为理性与预测和解释行为密切相关,因此与AI安全和对齐的考量以及更一般地理解模型行为相关联。
引用
@article{arxiv.2406.03442,
title = {Are language models rational? The case of coherence norms and belief revision},
author = {Thomas Hofweber and Peter Hase and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2406.03442},
year = {2025}
}
备注
substantial expansions of sections 4 and 5, updated references, numerous smaller additions and clarifications