EchoGuide:基于主动声学引导的LLM第一人称视频饮食事件分析
人机交互
2024-08-01 v2
摘要
自我记录饮食行为是许多健康专业人士推荐的健康生活方式的一步。然而,目前使用纸质记录或智能手机应用程序手动记录饮食活动的做法往往不可持续且不准确。智能眼镜已成为一种有前景的可穿戴设备形态,用于追踪饮食行为,但现有系统主要识别进食发生的时间,而无法捕捉饮食活动的细节(例如,吃了什么)。在本文中,我们介绍了EchoGuide,一个应用和系统流程,它利用低功耗主动声学传感来引导头戴式摄像头捕捉第一人称视频,从而实现对饮食活动的高效和详细分析。通过将用于进食检测的主动声学传感与视频字幕模型和用于检索增强的大规模语言模型相结合,EchoGuide智能地剪辑和分析视频,以创建关于饮食的简洁、相关的活动记录。我们在涉及饮食活动的自然环境中对9名参与者进行了EchoGuide评估,展示了高质量的摘要和所需视频数据量的显著减少,为实用、可扩展的饮食活动追踪铺平了道路。
引用
@article{arxiv.2406.10750,
title = {EchoGuide: Active Acoustic Guidance for LLM-Based Eating Event Analysis from Egocentric Videos},
author = {Vineet Parikh and Saif Mahmud and Devansh Agarwal and Ke Li and François Guimbretière and Cheng Zhang},
journal= {arXiv preprint arXiv:2406.10750},
year = {2024}
}
备注
Accepted at ISWC '24