VoiceAlign:增强遗留语音用户界面系统可用性的垫片层
人机交互
2026-02-27 v1
摘要
语音用户界面(VUI)正从无障碍功能转变为主流交互方式。然而,大多数操作系统内置的语音命令仍未得到广泛利用,尽管技术能力相当强大。通过对四个商业 VUI 系统的分析和对 16 名参与者的形式化研究,我们发现固定的命令格式需要精确的说话方式,限制性的超时机制在规划暂停期间会丢弃输入,以及不足的反馈会阻碍多步骤交互。为了应对这些挑战,我们开发了 VoiceAlign,一个适应性的垫片层,用于在用户和遗留 VUI 系统之间进行中介。VoiceAlign 拦截自然语音命令,通过大型语言模型将其转换为匹配所需语法的命令,然后通过不透明于底层系统的虚拟音频通道传输这些适应后的命令。在我们对 12 名参与者的评估中,VoiceAlign 将命令失败率减半,所需命令数减少 25%,并且在与现有遗留 VUI 系统配合使用时,显著降低了认知和时间需求。此外,我们创建了一个由我们的研究所启发的合成数据集,并微调了一个小型语言模型,在本地部署时实现超过 90% 的准确率,响应时间为 200 毫秒,无需依赖第三方 API,即可在边缘设备上实现实时交互。该 work 表明,现代 AI 技术无需要求系统修改即可释放遗留 VUI 系统的开发潜力,提供一种实用的解决方案而无需替换现有基础设施。
引用
@article{arxiv.2602.22374,
title = {VoiceAlign: A Shimming Layer for Enhancing the Usability of Legacy Voice User Interface Systems},
author = {Md Ehtesham-Ul-Haque and Syed Masum Billah},
journal= {arXiv preprint arXiv:2602.22374},
year = {2026}
}
备注
Accepted at IUI'26