对齐存在幻想问题
人工智能
2026-04-24 v1 人机交互
摘要
现代AI助手训练遵循指令,隐含假设用户能够清晰表达其目标以及所需的帮助类型。然而,数十年的行为研究表明,人们常常在目标形成之前就与AI系统进行交互。当AI系统将提示视为意图的完整表达时,虽可能显得有用或方便,但并不一定与用户的需求相吻合。我们称这些失败为幻想互动。我们认为,幻想互动需要重新思考对齐研究:而不是将用户视为理性的占频人,AI应通过积极帮助用户在时间上形成和细化其意图来提供认知支持。这需要一种跨学科方法,将机器学习、界面设计和行为科学相结合。我们综合这些领域的见解来刻画幻想互动的机制与失败。我们随后表明现有干预措施不足,并提出一项研究议程,用于设计和评估更有助于用户在任务中不确定性上进行导航的AI系统。
引用
@article{arxiv.2604.21827,
title = {Alignment has a Fantasia Problem},
author = {Nathanael Jo and Zoe De Simone and Mitchell Gordon and Ashia Wilson},
journal= {arXiv preprint arXiv:2604.21827},
year = {2026}
}
备注
9 pages, 2 figures