我们能信任AI 推断的用户状态吗?一个用于验证运营环境中LLM 用户状态分类可靠性的心理测量学框架
人工智能
2026-05-18 v1
摘要
在对话式和自适应系统中使用大语言模型来评估用户状态,是基于这样一个假设:用于此类评估的度量指标在个体分数层面上是稳定且可解释的。本文通过实证检验了这一假设,重点关注人工智能用户状态度量的心理测量学可靠性。本研究采用重复评估程序,评估了跨三种不同双模态大语言模型(GPT-4o audio、Gemini 2.0 Flash、Gemini 2.5 Flash)的广泛度量指标集的可重复性。分析包括个体分数可靠性和聚合可靠性,使我们能够区分出可能对实时适应有用的度量指标,以及那些仅在聚合分析中才保留其价值的度量指标。结果表明,在解释性领域中,度量可靠性不能被视为默认属性。个体分数层面缺乏稳定性,使得我们无法将这些分数解释为实时自适应系统中用户状态的指标,即使这些度量指标在聚合后显示出稳定性。同时,研究表明,个体不稳定的度量指标在事后研究中仍可保留分析效用,用于识别交互规则及其与用户体验参数(如满意度、信任度和参与度)的关系。除了量化问题的严重性(213个度量指标中仅有31个符合标准)之外,这项工作的主要贡献在于提出了一个可复制的评估框架,从而能够对度量指标的适用性进行可量化的评估。这种方法支持更负责任的AI 自适应系统设计,其中对结果的解释需要明确验证可靠性,并监控随时间推移的违规情况。
引用
@article{arxiv.2605.15734,
title = {Can We Trust AI-Inferred User States. A Psychometric Framework for Validating the Reliability of Users States Classification by LLMs in Operational Environments},
author = {Izabella Krzeminska and Michal Butkiewicz and Ewa Komkowska},
journal= {arXiv preprint arXiv:2605.15734},
year = {2026}
}
备注
Full survey article with data tables for futher possible replicabilty and comparison