面向隐私保护被动膳食摄入监测的第一视角图像描述生成
计算机视觉与模式识别
2023-03-02 v2
摘要
基于相机的被动膳食摄入监测能够持续捕获受试者的进食片段,记录丰富的视觉信息,例如所消耗食物的类型和体积,以及受试者的进食行为。然而,目前尚无方法能够整合这些视觉线索并从被动记录中提供膳食摄入的全面情境(例如,受试者是否与他人共享食物、受试者正在吃什么、碗中剩余多少食物)。另一方面,在使用第一视角可穿戴相机进行捕获时,隐私是一个主要问题。在本文中,我们提出了一种用于被动监测膳食评估的隐私保护安全方案(即第一视角图像描述生成),其统一了食物识别、体积估计和场景理解。通过将图像转换为丰富的文本描述,营养师可以基于描述而非原始图像评估个体的膳食摄入,从而降低图像隐私泄露的风险。为此,我们构建了一个第一视角膳食图像描述数据集,其包含在加纳实地研究中由头戴式和胸戴式相机捕获的真实场景图像。我们设计了一种基于 transformer 的新颖架构来描述第一视角膳食图像。我们进行了全面的实验以评估所提架构的有效性并论证其设计合理性。据我们所知,这是首项将图像描述生成应用于真实环境膳食摄入评估的工作。
引用
@article{arxiv.2107.00372,
title = {Egocentric Image Captioning for Privacy-Preserved Passive Dietary Intake Monitoring},
author = {Jianing Qiu and Frank P. -W. Lo and Xiao Gu and Modou L. Jobarteh and Wenyan Jia and Tom Baranowski and Matilda Steiner-Asiedu and Alex K. Anderson and Megan A McCrory and Edward Sazonov and Mingui Sun and Gary Frost and Benny Lo},
journal= {arXiv preprint arXiv:2107.00372},
year = {2023}
}