面向 LLM 智能家居的异常设备状态与行为情境基准测试
机器学习
2026-03-10 v1 人工智能
摘要
由于大型语言模型(LLM)展示出强大的上下文感知能力,最近的研究开始探索将其集成到智能家居助手中,以帮助用户管理和调整其居住环境。虽然 LLM 已被证明能够有效理解用户需求并提供恰当的响应,但大多数现有研究主要聚焦于解释和执行用户行为或指令。然而,智能家居助手的关键功能是检测家庭环境是否处于异常状态。这涉及两个关键要求:LLM 必须准确确定是否存在异常情况,并提供清晰的解释或可操作的建议。为提升下一代 LLM 基于智能家居助手的异常检测能力,我们引入 SmartBench,这是第一个为 LLM 设计的智能家居数据集,包含正常与异常设备状态以及正常与异常设备状态转换情境。我们在该基准上评估了 13 个主流 LLM。实验结果表明,大多数最先进的模型无法实现良好的异常检测性能。例如,Claude-Sonnet-4.5 在与情境无关的异常类别上仅实现 66.1% 的检测准确率,在情境依赖性异常上表现更差,准确率仅为 57.8%。更详尽的实验结果表明,下一代基于 LLM 的智能家居助手仍远非能够有效检测和处理智能家居环境中的异常情况。我们的数据集已公开于 https://github.com/horizonsinzqs/SmartBench。
引用
@article{arxiv.2603.06636,
title = {SmartBench: Evaluating LLMs in Smart Homes with Anomalous Device States and Behavioral Contexts},
author = {Qingsong Zou and Zhi Yan and Zhiyao Xu and Kuofeng Gao and Jingyu Xiao and Yong Jiang},
journal= {arXiv preprint arXiv:2603.06636},
year = {2026}
}