TCBERT:面向中文主题分类 BERT 的技术报告
计算与语言
2022-11-22 v1
摘要
基于 Transformer 的双向编码器表示(BERT)~\cite{devlin-etal-2019-bert} 因其卓越性能已成为各类 NLP 任务的基础模型之一。为进一步提升性能,提出了面向不同语言与任务定制的变体。本工作中,我们研究在 BERT 上针对中文主题分类任务进行有监督继续预训练~\cite{gururangan-etal-2020-dont}。具体而言,我们将基于提示的学习与对比学习融入预训练。为适配中文主题分类任务,我们收集了约 2.1M 涵盖多主题的中文数据。不同参数规模的中文主题分类 BERT(TCBERTs)已在 \url{https://huggingface.co/IDEA-CCNL} 开源。
引用
@article{arxiv.2211.11304,
title = {TCBERT: A Technical Report for Chinese Topic Classification BERT},
author = {Ting Han and Kunhao Pan and Xinyu Chen and Dingjie Song and Yuchen Fan and Xinyu Gao and Ruyi Gan and Jiaxing Zhang},
journal= {arXiv preprint arXiv:2211.11304},
year = {2022}
}