面向无触发语音助手的高效多模态神经网络
机器学习
2023-05-23 v1 人机交互
摘要
语音助手(VAs)对多模态交互的采用正快速增长,以增强人机交互。智能手表现已引入无触发调用 VAs 的方法,例如抬腕即说(RTS),用户抬起手表并对 VAs 说话而无需显式触发。当前最先进的 RTS 系统依赖启发式方法和工程化的有限状态机来融合手势与音频数据进行多模态决策。然而,这些方法存在局限性,包括适应性、可扩展性有限以及引入的人为偏差。在本工作中,我们提出一种基于神经网络的音频-手势多模态融合系统,其(1)更好地理解音频与手势数据间的时间相关性,从而实现精准调用;(2)泛化至广泛的环境与场景;(3)轻量且可部署于智能手表等低功耗设备,并具有快速启动时间;(4)提升资产开发流程中的生产效率。
引用
@article{arxiv.2305.12063,
title = {Efficient Multimodal Neural Networks for Trigger-less Voice Assistants},
author = {Sai Srujana Buddi and Utkarsh Oggy Sarawgi and Tashweena Heeramun and Karan Sawnhey and Ed Yanosik and Saravana Rathinam and Saurabh Adya},
journal= {arXiv preprint arXiv:2305.12063},
year = {2023}
}