中文

印度语言多语言文本风格迁移:数据集与模型

计算与语言 2024-08-28 v3

摘要

文本风格迁移(TST)涉及在保留核心内容的同时改变文本的语言风格。本文聚焦于印度语言范围内的情感风格迁移,包括孟加拉、马拉拉纳、泰米尔、马拉雅拉姆、旁遮普、奥利亚、泰卢固和乌尔都尔八种语言,扩展了前期关于英语-孟加拉情感风格迁移的工作(Mukherjee 等,2023)。我们为这八种语言各引入1000个积极和1000个消极风格平行句子的数据集。随后,我们评估了various基准模型的性能,这些模型按并行、非并行、跨语言和共享学习方法分类,包括Llama2和GPT-3.5大语言模型(LLM)。我们的实验突显了TST中平行数据的重要性,并展示了Masked Style Filling(MSF)方法(Mukherjee 等,2023)在非并行技术中的有效性。此外,跨语言和联合多语言学习方法显示出前景,为选择针对特定语言和任务要求的最佳模型提供了见解。据我们所知,本工作代表了首次对TST任务作为情感风格迁移在多样化语言集合上的全面探索。

关键词

引用

@article{arxiv.2405.20805,
  title  = {Multilingual Text Style Transfer: Datasets & Models for Indian Languages},
  author = {Sourabrata Mukherjee and Atul Kr. Ojha and Akanksha Bansal and Deepak Alok and John P. McCrae and Ondřej Dušek},
  journal= {arXiv preprint arXiv:2405.20805},
  year   = {2024}
}