基于视频的多模态模糊/犹豫识别用于个性化数字健康干预
计算机视觉与模式识别
2026-05-05 v3 人机交互
机器学习
摘要
利用行为科学,健康干预通过提供框架帮助患者获取和维持改善医疗结果的健康习惯。在现场干预成本高昂且难以扩展,尤其在资源受限地区。数字健康干预提供了具有成本效益的替代方案, potentially 支持独立生活和自我管理。通过机器学习自动化此类干预最近受到广泛关注。模糊和犹豫 (Ambivalence and Hesitancy, A/H) 在个体延迟、回避或放弃健康干预方面发挥着主要作用。A/H 是一种微妙且充满冲突的情感,使个体处于行为正面与负面评估之间,或处于接受与拒绝参与其中之间。它们表现为跨模态或同一模态内情感不一致,例如语言、面部、声音表情和身体语言。虽然专家可以训练识别 A/H,但将其整合到数字健康干预中成本高昂且效果有限。因此,自动 A/H 识别对于数字健康干预的个性化和成本效益至关重要。本文探索了深度学习模型用于视频中 A/H 识别的应用,这是一种本质上是多模态的任务。特别是,本文涵盖三种学习设置:监督学习、用于个性化的无监督域适应以及通过大型语言模型 (LLM) 的零样推断。我们的实验在独特且最近发布的用于 A/H 识别的 BAH 视频数据集上进行。我们的结果表明性能有限,表明需要更适应的多模态模型才能实现准确的 A/H 识别。更适用于建模时空和多模态融合的方法是必要的,以充分利用跨/模态内的冲突。
引用
@article{arxiv.2604.11730,
title = {Multimodal Ambivalence/Hesitancy Recognition in Videos for Personalized Digital Health Interventions},
author = {Manuela González-González and Soufiane Belharbi and Muhammad Osama Zeeshan and Masoumeh Sharafi and Muhammad Haseeb Aslam and Lorenzo Sia and Nicolas Richet and Marco Pedersoli and Alessandro Lameiras Koerich and Simon L Bacon and Eric Granger},
journal= {arXiv preprint arXiv:2604.11730},
year = {2026}
}
备注
11 pages, 3 figures. arXiv admin note: substantial text overlap with arXiv:2505.19328