利用具有迭代循环结构的大语言模型增强视频问答中的社交智能
计算机视觉与模式识别
2025-03-28 v1
摘要
社交智能,即解读情感、意图和行为的能力,对于有效沟通和适应性响应至关重要。随着机器人和人工智能系统在护理、医疗和教育等领域日益普及,对能够自然地与人类交互的 AI 的需求不断增长。然而,创建能够无缝整合多种模态(如视觉和语音)的 AI 仍然是一项挑战。当前基于视频的社交智能方法依赖于通用视频识别或情感识别技术,常常忽视人机交互中固有的独特元素。为解决这一问题,我们提出了循环视频辩论(Looped Video Debating, LVD)框架,该框架将大语言模型(LLMs)与视觉信息(如面部表情和身体动作)相结合,以增强涉及人类交互视频的问答任务的透明度和可靠性。我们在 Social-IQ 2.0 基准上的结果表明,LVD 在无需微调的情况下取得了 state-of-the-art 的性能。此外,对现有数据集的补充人工标注为模型的准确性提供了洞察,为未来 AI 驱动的社交智能改进指明了方向。
引用
@article{arxiv.2503.21190,
title = {Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering},
author = {Erika Mori and Yue Qiu and Hirokatsu Kataoka and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2503.21190},
year = {2025}
}