迈向 CLUE 语义匹配挑战赛第一:采用倾向修正损失的预训练语言模型 Erlangshen
计算与语言
2022-08-08 v1
摘要
本报告描述了采用倾向修正损失的预训练语言模型 Erlangshen,其在 CLUE 语义匹配挑战赛中获第一名。在预训练阶段,我们基于知识构建了一种在掩码语言建模(MLM)中采用全词掩码的动态掩码策略。此外,通过观察数据集的特定结构,预训练的 Erlangshen 在微调阶段应用倾向修正损失(PCL)。总体而言,我们在测试集上取得 72.54 的 F1 分数与 78.90 的准确率。我们的代码公开于:https://github.com/IDEA-CCNL/Fengshenbang-LM/tree/hf-ds/fengshen/examples/clue_sim。
引用
@article{arxiv.2208.02959,
title = {Towards No.1 in CLUE Semantic Matching Challenge: Pre-trained Language Model Erlangshen with Propensity-Corrected Loss},
author = {Junjie Wang and Yuxiang Zhang and Ping Yang and Ruyi Gan},
journal= {arXiv preprint arXiv:2208.02959},
year = {2022}
}