既然科学文献是多语言的,我们的模型亦应如此
计算与语言
2024-03-28 v1
摘要
长期以来,英语一直被视为科学研究的通用语(),这一观念也反映在涉及科学文档表示的自然语言处理(NLP)研究中。在这篇立场文章中,我们定量地表明文献在很大程度上是多语言的,并认为当前的模型和基准测试应反映这种语言多样性。我们提供证据表明,基于文本的模型无法为非英文论文创建有意义的表示,并强调在多语言领域不加区分地使用纯英文模型会对用户产生负面影响。最后,我们为 NLP 社区提供关于如何提升非英文文档性能的建议。
引用
@article{arxiv.2403.18251,
title = {Since the Scientific Literature Is Multilingual, Our Models Should Be Too},
author = {Abteen Ebrahimi and Kenneth Church},
journal= {arXiv preprint arXiv:2403.18251},
year = {2024}
}