低资源印度语言的反制言论生成:以孟加拉语和印地语为例
计算与语言
2024-02-13 v1 人机交互
摘要
随着在线辱骂的兴起,自然语言处理(NLP)社区已开始研究使用神经架构生成反制言论,以“反击”此类辱骂言论的恶毒语气,并削弱/改善其在社交网络上的连锁效应。然而,迄今为止的大部分努力主要集中在英语上。为了弥补孟加拉语和印地语等低资源语言的差距,我们创建了一个包含5,062对辱骂言论/反制言论的基准数据集,其中2,460对为孟加拉语,2,602对为印地语。我们实现了多个基线模型,考虑了具有不同配置的各种语际迁移机制,以生成合适的反制言论,从而建立一个有效的基准。我们观察到,单语设置产生了最佳性能。此外,通过合成迁移,语言模型可以在一定程度上生成反制言论;具体而言,我们注意到当语言属于同一语系时,可迁移性更好。
引用
@article{arxiv.2402.07262,
title = {Low-Resource Counterspeech Generation for Indic Languages: The Case of Bengali and Hindi},
author = {Mithun Das and Saurabh Kumar Pandey and Shivansh Sethi and Punyajoy Saha and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2402.07262},
year = {2024}
}
备注
Accepted to the Findings of the ACL: EACL 2024