构建台湾普通话口语语言模型:首次尝试
计算与语言
2024-12-30 v2 声音
音频与语音处理
摘要
本技术报告展示了我们构建台湾普通话口语大语言模型(LLM)的初步尝试,旨在实现多轮对话中的实时语音到语音交互。我们的端到端模型采用仅解码器Transformer架构,旨在实现无缝交互,同时保持对话流程,包括允许同时说话和聆听的全双工能力。论文还详述了训练过程,包括利用合成对话进行数据准备以及为实时交互所做的调整。我们还开发了一个平台,用于评估多轮对话中的会话流畅度和回复连贯性。希望本报告的发布能为台湾普通话口语大语言模型的未来发展做出贡献。
引用
@article{arxiv.2411.07111,
title = {Building a Taiwanese Mandarin Spoken Language Model: A First Attempt},
author = {Chih-Kai Yang and Yu-Kuan Fu and Chen-An Li and Yi-Cheng Lin and Yu-Xiang Lin and Wei-Chih Chen and Ho Lam Chung and Chun-Yi Kuan and Wei-Ping Huang and Ke-Han Lu and Tzu-Quan Lin and Hsiu-Hsuan Wang and En-Pei Hu and Chan-Jan Hsu and Liang-Hsuan Tseng and I-Hsiang Chiu and Ulin Sanga and Xuanjun Chen and Po-chun Hsu and Shu-wen Yang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2411.07111},
year = {2024}
}
备注
Work in progress