V-SAT:视频字幕标注工具
机器学习
2025-10-29 v1
摘要
流媒体平台和社交媒体上音视频内容的激增,提高了对准确可访问字幕的需求。然而,现有字幕生成方法主要基于语音转录或OCR提取,存在诸多局限,包括同步性差、文本错误或有害、格式不一致、阅读速度不合适以及无法适应动态音视频情境。当前方法常针对性地解决孤立问题,后期编辑仍是耗时耗力的过程。本文引入V-SAT(Video Subtitle Annotation Tool),一个统一框架,自动检测和纠正字幕质量问题广泛。通过结合大型语言模型(LLMs)、视觉语言模型(VLMs)、图像处理和自动语音识别(ASR),V-SAT利用音视频中的上下文线索。在解决所有语言模式问题后,字幕质量得到提升,SUBER分数从9.6降至3.54;图像模式问题的F1分数约为0.80。人类在环验证确保高质量结果,为稳健的字幕标注提供了首个综合解决方案。
引用
@article{arxiv.2510.24180,
title = {V-SAT: Video Subtitle Annotation Tool},
author = {Arpita Kundu and Joyita Chakraborty and Anindita Desarkar and Aritra Sen and Srushti Anil Patil and Vishwanathan Raman},
journal= {arXiv preprint arXiv:2510.24180},
year = {2025}
}