语音感知大型语言模型在ASR中的适配:基于单词级时间戳预测
音频与语音处理
2026-04-28 v1 计算与语言
机器学习
声音
摘要
近期进展表明,语音感知语言模型将强大的声学编码器与大型语言模型结合,使系统能够超越转录,产生更丰富的输出。在其中,单词级时间戳预测对于字幕、媒体搜索和多模态同步等应用至关重要,但通常由外部对齐工具处理。本文扩展现有的语音感知语言模型,直接预测转录文本伴随的时间戳。我们引入一组新型轻量级训练策略,在保持识别质量的同时提高对齐鲁棒性。实验表明,这些策略不仅提升了时间戳精度,也带来了整体ASR性能的提升。结果表明,这是一种高效且统一的语音识别方法,能够实现精确的时间戳预测。
引用
@article{arxiv.2604.22817,
title = {In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions},
author = {Xulin Fan and Vishal Sunder and Samuel Thomas and Mark Hasegawa-Johnson and Brian Kingsbury and George Saon},
journal= {arXiv preprint arXiv:2604.22817},
year = {2026}
}
备注
Accepted to ICASSP 2026