ReXSonoVQA:面向程序导向超声理解的视频问答基准
计算机视觉与模式识别
2026-04-20 v3 人工智能
摘要
超声采集需要技巧熟练的探头操作和实时调整。视觉语言模型(VLM)可实现自动化超声系统,但现有基准仅评估静态图像,无法衡量动态程序理解能力。我们引入 ReXSonoVQA,一个包含 514 个视频剪辑和 514 个问题(249 个多选问,265 个非选择问)的视频问答基准,针对三个核心能力进行设计:动作-目标推理、制品解析与优化、程序上下文与规划。对 Gemini 3 Pro、Qwen3.5-397B、LLaVA-Video-72B 和 Seed 2.0 Pro 的零样本评估表明,VLM 能够提取一些程序信息,但对排除性问题仍具有挑战性,仅略增于文本基线,暴露了因果推理的局限性。ReXSonoVQA 为开发超声训练、指导和机器人自动化的感知系统提供了可能。
引用
@article{arxiv.2604.10916,
title = {ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding},
author = {Xucheng Wang and Xiaoman Zhang and Sung Eun Kim and Ankit Pal and Pranav Rajpurkar},
journal= {arXiv preprint arXiv:2604.10916},
year = {2026}
}