AROMA:基于多模态信息在现实与视频之间实现非视觉烹饪的混合自主 AI 辅助
人机交互
2025-07-16 v1
摘要
视频提供了丰富的音视频信息,可支持人们完成日常生活活动(ADL),但这些视频对盲人或低视力(BLV)个体几乎没有被利用。在烹饪中,BLV 人们常常依赖非视觉线索,如触摸、品尝和嗅觉来导航环境,这使得他们难以遵循以音视频为主的食谱指令。为此,我们引入 AROMA,一个通过整合用户感知的非视觉线索、可穿戴摄像头画面以及视频食谱内容,为用户提供基于实时、情境感知的协助性响应的 AI 系统。AROMA 采用混合自主方法:它既响应用户请求,又主动监控视频流,提供及时警报和指导。这种协作设计利用用户和 AI 系统的互补优势,将物理环境与视频食谱对齐,帮助用户理解当前的烹饪状态并掌握步骤。我们通过对八名 BLV 参与者的研究对 AROMA 进行评估,并为设计支持 BLV 个体完成 ADL 的交互式 AI 系统提供了见解。
引用
@article{arxiv.2507.10963,
title = {AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos},
author = {Zheng Ning and Leyang Li and Daniel Killough and JooYoung Seo and Patrick Carrington and Yapeng Tian and Yuhang Zhao and Franklin Mingzhe Li and Toby Jia-Jun Li},
journal= {arXiv preprint arXiv:2507.10963},
year = {2025}
}