AugSumm:利用大语言模型合成标签实现可泛化的语音摘要
计算与语言
2024-10-28 v1 人工智能
摘要
抽象式语音摘要(SSUM)旨在从语音中生成类似人类的摘要。鉴于所捕获信息和措辞的差异,录音可以以多种方式进行总结。因此,考虑所有潜在摘要的概率分布比单一摘要更为合理。然而,传统的 SSUM 模型大多针对每条录音使用单一的真实(GT)人工标注确定性摘要进行训练和评估。生成多个人工参考摘要能更好地从统计上表示分布,是理想的做法,但由于标注成本高昂而不可行。我们通过提出 AugSumm 来应对这一挑战,该方法利用大语言模型(LLMs)作为人类标注者的代理,生成用于训练和评估的增强摘要。首先,我们探索了从 ChatGPT 生成合成摘要的提示策略。我们使用包括人工评估在内的多种指标验证了合成摘要的质量,发现使用 AugSumm 生成的摘要被人类认为更有效。其次,我们开发了在训练和评估中利用合成摘要的方法。在 How2 上的实验表明,在合成摘要上进行预训练并在 GT 摘要上进行微调,在 GT 和基于 AugSumm 的测试集上均将 ROUGE-L 提高了 1 个点。AugSumm 摘要可在 https://github.com/Jungjee/AugSumm 获取。
引用
@article{arxiv.2401.06806,
title = {AugSumm: towards generalizable speech summarization using synthetic labels from large language model},
author = {Jee-weon Jung and Roshan Sharma and William Chen and Bhiksha Raj and Shinji Watanabe},
journal= {arXiv preprint arXiv:2401.06806},
year = {2024}
}
备注
This work has been submitted to the IEEE ICASSP for possible publication. 5 pages