Gazeify 再 Voiceify:通过注视和语音与无显示智能眼镜进行物理对象指代
人机交互
2026-01-28 v1
摘要
智能眼镜通过头部摄像头观察用户视点来增强与环境的交互,但缺乏用于常见交互的视觉反馈。我们引入Gazeify 再 Voiceify,一种利用注视和语音进行对象选择的多模态方法,适用于无显示的智能眼镜。用户可通过注视选择物理对象,系统生成该对象的数字掩码及语义描述。用户可通过自由形式的对话进一步纠正错误。为演示该方法,我们开发了一个集成了先进对象分割和检测与视觉语言模型的交互系统。用户研究显示,受试者在53%的任务试验中实现正确的注视选择,并利用语音消歧纠正剩余58%的错误。受试者还对该系统在可喜、实用和易用性方面表现出良好评价。
引用
@article{arxiv.2601.19281,
title = {Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses},
author = {Zheng Zhang and Mengjie Yu and Tianyi Wang and Kashyap Todi and Ajoy Savio Fernandes and Yue Liu and Haijun Xia and Tovi Grossman and Tanya Jonker},
journal= {arXiv preprint arXiv:2601.19281},
year = {2026}
}