中文

Instituto de Telecomunicações 在 IWSLT 2025:对齐小规模语音和语言模型用于语音到文本学习

计算与语言 2025-06-23 v1 人工智能

摘要

本文介绍了IT-IST提交给IWSLT 2025指令跟随语音处理共享任务的结果。我们提交了短轨道的成果,即语音识别、翻译和口语问答。我们的模型是一个统一的语音到文本模型,通过第一阶段的模态对齐和第二阶段的指令微调,集成了预训练的连续语音编码器和文本解码器。关键的是,我们专注于使用小规模语言模型骨干(< 2B),并限制使用高质量的CC-BY数据以及合成数据生成来补充现有资源。

关键词

引用

@article{arxiv.2506.17019,
  title  = {Instituto de Telecomunica\c{c}\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning},
  author = {Giuseppe Attanasio and Sonal Sannigrahi and Ben Peters and André F. T. Martins},
  journal= {arXiv preprint arXiv:2506.17019},
  year   = {2025}
}

备注

7 pages, 1 figure, IWSLT 2025