基于音频到文本对齐的多媒体内容抽取式摘要的级联架构
信息检索
2025-04-10 v1 人工智能
声音
音频与语音处理
摘要
本研究提出了一种基于音频到文本对齐的多媒体内容抽取式摘要级联架构。该框架旨在从类似 YouTube 视频等多媒体来源中提取关键信息。系统集成了基于 Microsoft Azure Speech 的音频到文本转换技术,以及 Whisper、Pegasus 和 Facebook BART XSum 等先进的抽取式摘要模型。该系统运用 Pytube、Pydub 和 SpeechRecognition 等工具实现内容检索、音频提取和语音转文字。通过命名实体识别和语义角色标注等技术提升语言分析效果。实验使用 ROUGE 和 F1 分数进行评估,结果表明,尽管存在转录错误等挑战,级联架构仍优于传统摘要方法。未来可通过模型微调和实时处理进行改进。该研究通过提升信息检索、可访问性和用户体验,推动了多媒体摘要技术的发展。
引用
@article{arxiv.2504.06275,
title = {A Cascaded Architecture for Extractive Summarization of Multimedia Content via Audio-to-Text Alignment},
author = {Tanzir Hossain and Ar-Rafi Islam and Md. Sabbir Hossain and Annajiat Alim Rasel},
journal= {arXiv preprint arXiv:2504.06275},
year = {2025}
}