中文

Sensor2Text:利用可穿戴传感器实现日常活动追踪的自然语言交互

机器学习 2024-10-29 v1 人工智能 人机交互

摘要

视觉问答是一项根据图像和自然语言问题生成文本响应的技术,目前已取得显著进展。值得注意的是,它能够辅助追踪和查询日常活动,这在医疗保健监测中至关重要,特别是对于老年患者或有记忆障碍的患者。然而,视频存在隐私担忧且视野有限。本文提出了 Sensor2Text,一个熟练使用可穿戴传感器追踪日常活动并进行对话的模型。这里概述的方法解决了几个挑战,包括可穿戴传感器数据信息密度低、单一可穿戴传感器在人类活动识别中的不足,以及模型在问答和交互对话方面的能力有限。为了解决这些障碍,利用迁移学习和师生网络从视觉语言模型中获取知识。此外,设计了一个编码器-解码器神经网络模型,以联合处理语言和传感器数据用于对话目的。进一步地,还利用大型语言模型来实现交互能力。该模型展示了使用各种可穿戴传感器模态识别人类活动并进行问答对话的能力。在描述和对话任务中,其表现与现有的视觉语言模型相当或更优。据我们所知,这是第一个能够就可穿戴传感器数据进行对话的模型,为日常活动追踪提供了一种创新方法,解决了当前基于视觉的解决方案所存在的隐私和视野限制问题。

关键词

引用

@article{arxiv.2410.20034,
  title  = {Sensor2Text: Enabling Natural Language Interactions for Daily Activity Tracking Using Wearable Sensors},
  author = {Wenqiang Chen and Jiaxuan Cheng and Leyao Wang and Wei Zhao and Wojciech Matusik},
  journal= {arXiv preprint arXiv:2410.20034},
  year   = {2024}
}