是否应该拒绝?面向智能家居场景的语音助理查询拒绝基准及基于LLM的改进方法
人机交互
2025-12-15 v2
摘要
在智能家居语音助理场景中,决定是否接受用户查询是任何后续处理的第一步。为解决当前语音助理查询拒绝能力有限的问题,本文提出首个面向中文的开源基准和评估套件,以及基于大型语言模型的个性化查询拒绝方法。数据方面,我们构建了第一个针对家庭场景的多模态查询拒绝数据集,包含11,913个手动标注的文本-语音对,系统覆盖十二种典型对话类型(如闲聊、非人声声音、有效指令、模糊指代、与设备无关的请求等)。提供细粒度标签、对话上下文和多轮信息,支持跨语言和多模态大模型的零样本和微调评估。在方法方面,我们提出三级协作架构:第一级使用针对家庭场景微调的Qwen-2.5-3B适配器建模家庭无关的语义边界;第二级动态 household 级别的历史对话模块捕获个性化习惯;第三级基于 household 的RAG知识库显式记忆并修订过去的误拒案例。实验表明,所提方法在构建的数据集上显著优于零样本和微调的通用LLM,尤其在针对家庭特定表达和复杂多轮场景的拒绝准确率上取得显著提升。本工作提供了可复现的数据基础、评估标准和可扩展技术框架,为智能家居语音交互的可靠性研究提供支持。
引用
@article{arxiv.2512.10257,
title = {Reject or Not?: A Benchmark for Voice Assistant Query Rejection in Smart Home Scenario and an Improved Method Based on LLMs},
author = {Huichao Men and Yizhen Hu and Yingyang He and Yu Gao and Xiaofeng Mou and Yi Xu},
journal= {arXiv preprint arXiv:2512.10257},
year = {2025}
}