通过跨域方法提升葡萄牙语变体识别
计算与语言
2025-02-21 v1
摘要
近期自然语言处理的进展提高了期望生成模型能够在多样化语言变体之间产生连贯文本的水平。尤其是在葡萄牙语方面, 在线上占主导地位的巴西葡萄牙语语料引入了语言偏见, 限制了这些模型在巴西之外的适用性。为弥补这一差距并促进欧洲葡萄牙语资源的创建, 我们开发了一个跨域语言变体识别器 (LVI), 用于区分欧洲葡萄牙语和巴西葡萄牙语。针对我们文献综述的发现, 我们构建了 PtBrVarId 语料库, 一个跨域 LVI 数据集, 并研究了基于 transformer 的 LVI 分类器在跨域情景下的有效性。虽然本研究聚焦于两种葡萄牙语变体, 但我们的贡献可以扩展到其他变体和语言。我们开源代码、语料库和模型, 以促进该任务的进一步研究。
引用
@article{arxiv.2502.14394,
title = {Enhancing Portuguese Variety Identification with Cross-Domain Approaches},
author = {Hugo Sousa and Rúben Almeida and Purificação Silvano and Inês Cantante and Ricardo Campos and Alípio Jorge},
journal= {arXiv preprint arXiv:2502.14394},
year = {2025}
}
备注
AAAI 2025