idT5:多语言 T5 Transformer 的印尼语版本
计算与语言
2024-10-28 v2
摘要
印尼语由近 2 亿人使用,是世界上第 10 大语言,但在自然语言处理(NLP)研究中代表性不足。语言资源的稀疏性阻碍了先前关于印尼语的工作。Transformer 是一种迅速成为 NLP 主导的新架构,超越了卷积与循环神经网络等替代方案。T5(Text-to-Text Transfer Transformer)是一种将所有基于文本的语言问题转换为文本到文本格式的英语 Transformer 模型。其多语言变体为 mT5(multilingual T5),已在跨语言的许多 NLP 任务上展现出有前景的结果。然而,该多语言模型的规模是其在实际生产应用中的缺点,而实际生产有时仅需一种语言。在本研究中,mT5 模型被适配为仅用于一种语言——印尼语,从而得到一个仅针对印尼语、规模更小的预训练 T5 模型。为进行性能比较,我们使用完全相同的机制与数据集将该模型与 mT5 模型微调至情感分析(SA)、问题生成(QG)与问答(QA)任务。基于我们模型的微调模型在 SA 上达到 77.18% 准确率,比基于 mT5 的模型高 8%,并在 QG 与 QA 上取得与基于 mT5 的模型几乎相同的分数。结果证实,有可能产出更小的预训练模型,在将模型规模缩减多达 58% 的同时保持可比产出。此外,所得模型所需内存更少、加载更快且推理时间更短。
引用
@article{arxiv.2302.00856,
title = {idT5: Indonesian Version of Multilingual T5 Transformer},
author = {Mukhlish Fuadi and Adhi Dharma Wibawa and Surya Sumpeno},
journal= {arXiv preprint arXiv:2302.00856},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication