从人机交互中学习下一动作预测器
计算与语言
2026-03-09 v1 人机交互
摘要
真正主动的AI系统必须预见我们下一步会做什么。这种预见需要远超我们稀疏输入提示所携带的信息——它需要对我们所见所作的整个上下文进行推理。我们将此形式化为下一动作预测(Next Action Prediction, NAP):给定用户与计算机之间的多模态交互序列(屏幕截图、点击、传感器数据),预测该用户的下一步动作。在该任务上取得进展需要新的数据和建模方法。为扩大数据规模,我们使用视觉-语言模型对长时段、自然的计算机使用情况进行标注。我们发布了一个可在私有基础设施上执行的开源标注管道,并在20位用户连续一个月的使用中完成了36万多项动作标注,相当于1800小时的屏幕使用时间。随后,我们引入LongNAP,一种结合参数学习和情境学习的用户模型,能够对长交互历史进行推理。LongNAP通过策略梯度方法训练,用于生成给定上下文的用户特定推理痕迹;检索过去痕迹库中相关痕迹;然后将检索到的痕迹在情境中应用于预测未来动作。在基于LLM评判器的评估指标(0-1相似度与真实情况)下,LongNAP在留样数据上显著优于监督微调和提示基线(分别提升79%和39%)。此外,LongNAP在跨用户训练时也能对留出用户实现泛化。用户可能在任意时刻采取的下一步行动空间是无限的,涵盖数千种可能结果。尽管如此,LongNAP预测的17.1%的轨迹与用户下一步实际操作高度吻合(LLM评判得分≥0.5)。当我们筛选出高度自信的预测后,这一比例提升至26%。总之,我们认为,利用用户行为的完整上下文来预测用户需求如今已成为可行任务,且具有巨大的机遇。
引用
@article{arxiv.2603.05923,
title = {Learning Next Action Predictors from Human-Computer Interaction},
author = {Omar Shaikh and Valentin Teutschbein and Kanishk Gandhi and Yikun Chi and Nick Haber and Thomas Robinson and Nilam Ram and Byron Reeves and Sherry Yang and Michael S. Bernstein and Diyi Yang},
journal= {arXiv preprint arXiv:2603.05923},
year = {2026}
}
备注
32 pages, 10 figures, see https://generalusermodels.github.io/nap