中文

评估大语言模型在智能环境中的少样本时序推理能力用于人类活动预测

计算与语言 2026-02-13 v1 人工智能 计算工程、金融与科学 机器学习

摘要

预测人类活动及其持续时间是智能家居、仿真式建筑与城市设计、基于活动的交通系统仿真以及人机协作等应用中的关键需求,这些场景下的自适应系统必须能够应对人类活动。现有的基于数据的代理模型——从基于规则到深度学习——在数据稀缺的环境中表现不佳,受限于实用性。本文探讨了大型语言模型(LLM)是否可以通过从紧凑的情境线索推理日常活动,从而填补这一空白。我们采用检索增强的提示策略,将四种情境信息整合进模型:时间、空间、行为历史和人格特征。我们在 CASAS Aruba 智能家居数据集上进行评估。评估包括两种互补任务:基于给定少样本示例的下一活动预测(含时长估计)和多步日常序列生成,每种任务都测试了不同数量的少样本示例。分析少样本效果揭示了数据效率与预测准确性之间所需的情境监督程度,尤其在数据稀缺的环境中尤为关键。结果表明,大型语言模型展现出强大的内在时序理解能力:即使在零样本设置下,模型也能生成连贯的日常活动预测;添加一个或两个示例进一步细化了时长校准和类别准确率。超过少样本后,性能趋于饱和,表明收益递减。序列层面的评估确认了少样本条件下的时间对齐一致性。这些发现表明,预训练语言模型可作为有前景的时序推理器,捕捉到循环例行和情境依赖性行为变异,从而强化代理模型的行为模块。

关键词

引用

@article{arxiv.2602.11176,
  title  = {Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments},
  author = {Maral Doctorarastoo and Katherine A. Flanigan and Mario Bergés and Christopher McComb},
  journal= {arXiv preprint arXiv:2602.11176},
  year   = {2026}
}