中文

从零开始为低资源语言印尼构建对话理解模型

计算与语言 2024-10-25 v1

摘要

近期利用资源丰富语言的现成资源为低资源语言进行知识迁移引起了广泛关注。然而,使模型达到可靠性能的要求缺乏明确指导,例如所需注释数据的规模或有效框架。为探讨第一个问题,我们经验性地研究了用于印尼(ID)从零训练意图分类和槽位填充模型的几种方法的成本效益。面对第二个挑战,我们提出了Bi-Confidence-Frequency跨语言迁移框架(BiCF),由“BiCF混合”、“潜在空间细化”和“联合解码器”组成,旨�解决缺乏低资源语言对话数据的问题。广泛的实验表明,我们的框架在不同规模的手动注释印尼数据上表现可靠且成本效益高。我们发布了大规模精确标注的对话数据集(ID-WOZ)和印尼语言BERT模型(ID-BERT),供进一步研究使用。

关键词

引用

@article{arxiv.2410.18430,
  title  = {Building Dialogue Understanding Models for Low-resource Language Indonesian from Scratch},
  author = {Donglin Di and Weinan Zhang and Yue Zhang and Fanglin Wang},
  journal= {arXiv preprint arXiv:2410.18430},
  year   = {2024}
}