中文

来自传感器轨迹的因果叙事:审计 LLM 生成个人感知解释中的信念过度

人机交互 2026-05-12 v1 人工智能 计算与语言 计算机与社会

摘要

LLM 正在日益增多地用于解释个人感知数据,将活动和情绪的轨迹转化为自然语言的日子异常发生原因的叙述。然而,这些解释即使在底层证据稀疏或缺失的情况下,也可能听起来连贯且具有个人意义。我们提出信念过度(EO)作为生成的解释暗示的程度超过可用感知证据所能合理化的程度的度量标准。为审计 EO occur 的频率和形式,我们从三组大学生的纵向感知数据集中获取异常日场景:StudentLife、GLOBEM 和 CollegeExperience。对于活动、睡眠和情感异常,我们使用三个 LLM 家族——Llama、Qwen 和 GPT——在两种提示条件下生成 14,922 个解释:一种最小约束的提示,另一种显式指示模型将论点限制在数据范围内。对于每个场景,我们变化模型可用行为证据的数量,以检验更多证据是否减少 EO。我们使用结构化评分表对每个解释进行评估,将 EO 分解为不支持的因果归因、未被承认的数据空缺、过于自信的语言、时间不一致和诊断性推断等维度。我们发现 LLM 会对没有足够数据支持的原因进行归因,这一模式在数据集、异常类型和模型家族之间复制。进一步地,提供更丰富的上下文并不可靠地减少 EO;受限提示有助于但不消除它。这些发现表明,信念 grounding 应该是 LLM 生成的个人感知解释的首要评估标准,位于流畅性和合理性之外。我们认为,个人感知解释需要信念纪律:系统必须区分观察到的内容、推断的内容以及仍未知的内容。

关键词

引用

@article{arxiv.2605.08590,
  title  = {Causal Stories from Sensor Traces: Auditing Epistemic Overreach in LLM-Generated Personal Sensing Explanations},
  author = {Shanshan Zhu and Han Zhang and J. Doris Chi and Subigya Nepal and Koustuv Saha},
  journal= {arXiv preprint arXiv:2605.08590},
  year   = {2026}
}