中文

VideoFDB:评估对话式智能体的全双工视觉-语音能力

计算机视觉与模式识别 2026-05-29 v1 计算与语言 人机交互

摘要

自然的人类对话是全双工且具有音视频特征的:人们同时说话和倾听,不断解释和产生诸如点头、微笑和手势等非语言线索。为了支持成功的人机交互,智能体必须建模全双工音视频对话;然而,现有的全双工基准仅评估语音。本文提出了 VideoFDB,是第一个用于评估全双工音视频到音视频 (AV2AV) 对话式智能体的基准。VideoFDB 贡献包括:(i) 237 对称的剪辑,涵盖 11 种非语言对话动态,来自真实视频通话;(ii) 一个区分感知与生成行为的分类学;(iii) 基于 Rubric 的 LM-作为-裁判评估框架,提供可解释的轴来评估有关非语言对话动态的对话质量。我们发现,跨开放和封闭源的视觉-语音智能体在系统性失效模式方面存在问题:字幕坍缩和忽略视觉流;我们进一步表明,当前系统利用视觉进行显式视觉问答,但不用于自然对话中所需的流式联合音视频定位。我们进一步评估了级联语音到化身系统,发现其体系结构根本不允许产生全双工非语言线索。作为全双工 AV2AV 交互的第一个基准,VideoFDB 为系统性评估奠定了基础,期待加速下一代多模态对话式智能体的发展。

关键词

引用

@article{arxiv.2605.30256,
  title  = {VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents},
  author = {Amrita Mazumdar and Seonwook Park and Rajarshi Roy and Nikhil Srihari and Shengze Wang and Yuhao Zhou and Julia Wang and Koki Nagano and Shalini De Mello},
  journal= {arXiv preprint arXiv:2605.30256},
  year   = {2026}
}

备注

Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/