中文

基于大语言模型的多模态融合用于自然对话中的参与度预测

人工智能 2025-10-30 v1 计算与语言 人机交互 机器学习

摘要

过去十年,可穿戴计算设备(“智能眼镜”)在传感器技术、设计和处理能力方面取得了显著进步,为高密度人类行为数据开辟了新的机遇。这些眼镜配备可穿戴摄像头,为分析个体在自然环境中互动时的非言语行为提供了独特机会。我们的研究重点是通过审视言语和非言语线索来预测二元互动中的参与度,旨在检测兴趣缺失或困惑的迹象。利用此类分析可能会彻底改变我们对人类交流的理解,促进专业环境中更有效的协作,通过富有同理心的虚拟互动提供更好的心理健康支持,并为有沟通障碍的人提高可及性。在这项工作中,我们收集了一个包含 34 名参与者进行随意二元对话的数据集,每位参与者在每次对话结束时都提供了自我报告的参与度评分。我们引入了一种新颖的融合策略,利用大语言模型(LLMs)将多种行为模态整合成一个“多模态转录文本”,该文本可由大语言模型处理以进行行为推理任务。值得注意的是,即使在初步实现中,该方法也达到了与现有融合技术相当的性能,显示出进一步研究和优化的巨大潜力。这种融合方法是首批通过语言模型对现实世界人类行为进行“推理”的方法之一。智能眼镜使我们能够不引人注目地收集关于人类行为的高密度多模态数据,为理解和改善人类交流的新方法铺平了道路,并具有重要的社会效益潜力。研究期间收集的特征和数据将公开提供,以促进进一步的研究。

关键词

引用

@article{arxiv.2409.09135,
  title  = {Multimodal Fusion with LLMs for Engagement Prediction in Natural Conversation},
  author = {Cheng Charles Ma and Kevin Hyekang Joo and Alexandria K. Vail and Sunreeta Bhattacharya and Álvaro Fernández García and Kailana Baker-Matsuoka and Sheryl Mathew and Lori L. Holt and Fernando De la Torre},
  journal= {arXiv preprint arXiv:2409.09135},
  year   = {2025}
}

备注

22 pages, first three authors equal contribution