中文

面向语码混合语言的角色感知生成模型

计算与语言 2024-10-22 v2 机器学习

摘要

语码混合(code-mixing)与文字混合(script-mixing)在在线社交网络与多语社会中十分普遍。然而,用户对语码混合的偏好取决于其社会经济地位、人口统计特征及本地语境,而现有生成模型在生成语码混合文本时大多忽略这些因素。本文开创性尝试构建角色感知生成模型,以生成贴近个体真实语码混合文本的生成式模型。我们提出 PARADOX(Persona-aware Generative Model for Code-mixed Generation,面向语码混合生成的角色感知生成模型),一种基于 Transformer 的编码-解码新颖模型,其在无单语参考数据的条件下,以用户角色为条件对话语进行编码并生成语码混合文本。我们提出一个对齐模块,对生成序列重新校准以贴近真实语码混合文本。PARADOX 生成的语码混合文本在语义上更有意义、在语言学上更合理。为评估 PARADOX 的角色化能力,我们提出四个新指标——CM BLEU、CM Rouge-1、CM Rouge-L 与 CM KS。平均而言,PARADOX 相较非角色基准模型取得高 1.6 分的 CM BLEU、低 47% 的困惑度(perplexity)以及高 32% 的语义连贯性。

关键词

引用

@article{arxiv.2309.02915,
  title  = {Persona-aware Generative Model for Code-mixed Language},
  author = {Ayan Sengupta and Md Shad Akhtar and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2309.02915},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (TMLR)