TEDB 系统针对 2022 年委婉语检测共享任务的说明
计算与语言
2023-01-18 v1 机器学习
摘要
在本报告中,我们描述了用于 2022 年委婉语检测共享任务的 Transformers 委婉语检测基线(TEDB)提交方案。我们将委婉语预测任务视为文本分类。我们考虑了基于 Transformer 的模型,它们是当前文本分类的最先进(state-of-the-art)方法。我们探索了不同的训练方案、预训练模型和模型架构。我们的最佳结果为 0.816 的 F1 分数(0.818 精确率和 0.814 召回率),由一个针对委婉语检测微调的 TweetEval/TimeLMs 预训练 RoBERTa 模型作为特征提取前端,以及一个 KimCNN 分类器后端组成,并使用余弦退火调度器进行端到端训练。我们观察到在情感分析和攻击性检测上的预训练与更高的 F1 分数相关,而在其他任务(如讽刺检测)上的预训练产生较低的 F1 分数。此外,在我们的实验中,增加词向量通道数并不能提升性能。
引用
@article{arxiv.2301.06602,
title = {TEDB System Description to a Shared Task on Euphemism Detection 2022},
author = {Peratham Wiriyathammabhum},
journal= {arXiv preprint arXiv:2301.06602},
year = {2023}
}
备注
EMNLP workshop 2022 SharedTask report. FigLang 2022