SayNext-Bench:为何大语言模型在下一语预测方面受限?
人工智能
2026-05-12 v2 人机交互
摘要
我们探讨使用大语言模型 (LLM) 进行人类对话中的下一语预测。尽管近期进展表明 LLM 能够与用户进行自然对话,但我们发现即使是领先的模型在预测人类说话者的下一语方面仍存在显著困难。相比之下,人类能够基于多模态线索——如手势、凝视和情感语调——从上下文中轻松预测即将出现的语料。为系统性地检验这一差距,我们提出 SayNext-Bench,评估多模态大语言模型 (MMLLM) 在跨越多样真实场景的情境条件下预测响应的能力。为支持该基准,我们构建了 SayNext-PC,一个大规模多模态对话数据集,并仔细设计了涵盖词汇相似性、情感意图一致性以及 LLM 基于情感的整体对齐等多层次评估框架。基于此,我们开发了 SayNext-Chat,一种受认知启发的双路由 MLLM,融合可学习的引导记号以整合感知线索与预测性先验。大量实验表明,SayNext-Chat 在所有评估层面上均显著优于当前最先进的 MLLM,用户研究和 LLM 评判评估亦佐证其有效性。我们的结果强调了 (i) 多模态线索的必不可少作用,以及 (ii) 主动预测加工在当前 MLLM 中所缺失的人类自然交互的基础。
引用
@article{arxiv.2602.00327,
title = {SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?},
author = {Yueyi Yang and Haotian Liu and Fang Kang and Mengqi Zhang and Zheng Lian and Hao Tang and Haoyu Chen},
journal= {arXiv preprint arXiv:2602.00327},
year = {2026}
}