中文

TCEval:利用热力舒适度评估 AI 的认知与感知能力

人工智能 2025-12-30 v1

摘要

存在关键缺口在 LLM 任务特定基准测试中。热力舒适度,这种涉及环境因素和个人感知的复杂交互,涉及感觉整合和自适应决策,作为评估 AI 系统真实世界认知能力的理想范式。为此,我们提出 TCEval,即第一个评估框架,通过利用热力舒适情景和大语言模型(LLM)代理来评估 AI 的三个核心认知能力:跨模态推理、因果关联和自适应决策。方法涉及初始化 LLM 代理带有虚拟人格属性,引导其生成服装绝缘选择和热力舒适度反馈,并根据 ASHRAE 全球数据库和中国热力舒适度数据库验证输出。四个 LLM 的实验显示,尽管代理反馈与人类数据有限的精确一致性,但方向一致性在容忍 1 PMV 的情况下显著提高。统计测试揭示,LLM 生成的 PMV 分布与人类数据呈显著差异,代理在离散热力舒适度分类中表现近乎随机。这些结果确认了 TCEval 作为生态有效认知图灵测试的可行性,表明当前 LLM 具备基础的跨模态推理能力,但缺乏对热力舒适度变量之间非线性关系的精确因果理解。TCEval 补充传统基准测试,转变 AI 评估焦点从抽象任务专业能力到具身、情境感知和决策,为智能建筑等以人为本的应用提供宝贵见解。

关键词

引用

@article{arxiv.2512.23217,
  title  = {TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI},
  author = {Jingming Li},
  journal= {arXiv preprint arXiv:2512.23217},
  year   = {2025}
}