幻灯片有帮助吗?会议演讲的多模态上下文自动转录
人工智能
2025-10-17 v1 计算与语言
摘要
当前最先进的自动语音识别(ASR)系统主要依赖声学信息,忽略了额外的多模态上下文。然而,视觉信息在消除歧义和适应方面至关重要。虽然大多数工作专注于使用演讲者的图片来处理噪声条件,但本工作也关注整合演示幻灯片以适用于科学演示场景。在第一步中,我们构建了一个包含自动分析术语转换基准的数据集。随后,我们探索了将多模态信息增强到语音模型中的方法。我们通过合适的数据增强方法来缓解缺乏伴随幻灯片数据集的限制。最后,我们使用增强后的数据集训练模型,结果显示相对于基线模型,整体词错误率降低约34%,针对专有术语的词错误率降低约35%。
引用
@article{arxiv.2510.13979,
title = {Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks},
author = {Supriti Sinhamahapatra and Jan Niehues},
journal= {arXiv preprint arXiv:2510.13979},
year = {2025}
}