HomeBench:在智能家居中评估 LLM 处理跨单设备与多设备的有效及无效指令
计算与语言
2025-05-28 v2
摘要
大型语言模型(LLMs)有潜力通过增强智能家庭助手准确理解用户需求并做出恰当响应的能力,从而引发其革命性变化,这对于构建更智能的家庭环境极为有益。尽管近期研究探索了将 LLMs 集成到智能家居系统中,但它们主要侧重于处理简单、有效的单设备操作指令。然而,现实场景远比这复杂,通常涉及用户发出无效指令或同时控制多个设备。这带来了两个主要挑战:LLMs 必须准确识别并纠正用户指令中的错误,以及完美执行多条用户指令。为了应对这些挑战并推进基于 LLM 的智能家居助手的发展,本文引入了 HomeBench,这是首个包含跨单设备和多设备的有效及无效指令的智能家居数据集。我们在 13 个不同的 LLMs 上进行了实验;例如,GPT-4o 在无效多设备指令场景下的成功率仅为 0.0%,这表明即使借助上下文学习、检索增强生成和微调,现有的 SOTA LLMs 在这种情况下仍然表现不佳。我们的代码和数据集已公开发布于 https://github.com/BITHLP/HomeBench。
引用
@article{arxiv.2505.19628,
title = {HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices},
author = {Silin Li and Yuhang Guo and Jiashu Yao and Zeming Liu and Haifeng Wang},
journal= {arXiv preprint arXiv:2505.19628},
year = {2025}
}
备注
Accepted by ACL 2025 Main