基于多语言深度学习的开放网络自动文体识别
计算与语言
2026-02-10 v4
摘要
本文提出了用于跨 16 种语言识别网络文体(如新闻报道和讨论论坛等文本变体)的多语言深度学习模型。我们引入了 Multilingual CORE 语料库,其中包含超过 72,000 篇带有层次化的 25 种文体分类标签的文档,旨InListify覆盖整个开放网络。通过多标签分类,我们的最佳模型在语言上实现了 79% 的 F1 分数,达到或超过了使用更简单分类方案的前期研究水平。这表明即使在复杂的文体方案下,模型也能在多语言规模上表现良好。然而,我们观察到所有模型和配置之间都存在一致的性能天花板。当通过数据修剪移除标签不确定的文档后,性能提升至 90% 以上 F1 分数,表明这一天花板源于网络文体固有的模糊性,而非模型局限。分析混合文本(即组合多种文体的文本)的结果表明,主要挑战不在于对混合文本本身的分类,而在于区分混合文本与非混合文本。多语言模型始终优于单语言模型,尤其是针对训练数据有限的语言。对未见语言的零样本性能下降约 7%,但这种下降在不同语言间有 3--8% 的差异,这表明虽然文体在不同语言之间共享特征,但也保留了语言特定的特征。
引用
@article{arxiv.2406.19892,
title = {Automatic register identification for the open web using multilingual deep learning},
author = {Erik Henriksson and Amanda Myntti and Saara Hellström and Anni Eskelinen and Selcen Erten-Johansson and Veronika Laippala},
journal= {arXiv preprint arXiv:2406.19892},
year = {2026}
}