BERTweetFR:预训练语言模型在法语推文上的领域自适应
计算与语言
2021-09-22 v1
摘要
我们介绍了 BERTweetFR,这是首个面向法语推文的大规模预训练语言模型。我们的模型使用通用领域法语语言模型 CamemBERT 初始化,其遵循 RoBERTa 的基础架构。实验表明,在冒犯性识别与命名实体识别两项下游 Twitter NLP 任务上,BERTweetFR 优于此前所有通用领域法语语言模型。冒犯性检测任务所用数据集由我们团队首次创建并标注,填补了法语此类分析数据集的空白。我们在 transformers 库中公开了我们的模型,旨在推动未来针对法语推文分析任务的研究。
引用
@article{arxiv.2109.10234,
title = {BERTweetFR : Domain Adaptation of Pre-Trained Language Models for French Tweets},
author = {Yanzhu Guo and Virgile Rennard and Christos Xypolopoulos and Michalis Vazirgiannis},
journal= {arXiv preprint arXiv:2109.10234},
year = {2021}
}
备注
Accepted at the Seventh Workshop on Noisy User-generated Text (W-NUT 2021)