面向低资源语言机器翻译中的性别误称与性别预设
计算与语言
2024-03-13 v3
摘要
本章关注低资源语言背景下机器翻译(MT)中的性别相关错误。我们首先解释了什么是低资源语言,并考察了造成此类语言等级体系的不可分割的社会与计算因素。通过以我们的母语孟加拉语(全球近3亿人使用但仍被归类为低资源语言)为案例,我们展示了在源文本未提供性别信息时,在与资源最高(高)的英语进行互译时如何预设和推断性别。我们讨论了此类错误导致语言抹除和代表性损害的后殖民与社会影响,最后讨论了通过在机器翻译对话中赋予语言更多能动性以提升其地位的潜在解决方案。
引用
@article{arxiv.2401.13165,
title = {Misgendering and Assuming Gender in Machine Translation when Working with Low-Resource Languages},
author = {Sourojit Ghosh and Srishti Chatterjee},
journal= {arXiv preprint arXiv:2401.13165},
year = {2024}
}
备注
Upcoming Publication, Gendered Technology in Translation and Interpreting Centering Rights in the Development of Language Technology, Routledge 2024