用于识别网络报纸中政治意图的韩语文本分类新基准
计算与语言
2023-11-06 v1
摘要
许多阅读各类杂志网络文章的用户可能在辨别文本中的隐含意图时遇到相当大的困难。在本工作中,我们专注于通过理解文本语境来自动识别给定网络报纸的政治意图。为解决该任务,我们提出了一个包含多种文章的新型韩语文本分类数据集。我们还提供了基于深度学习、在该提出的数据集上训练的文本分类基线模型。我们的数据集包含来自韩国最具代表性的六家报纸机构政治版块的12,000篇可能含有政治意图的新闻文章。所有文本样本均从两个方面同时标注:(1) 政治倾向程度与 (2) 亲政府程度。据我们所知,我们的论文是规模最大、包含长文本并解决多任务分类问题的韩语新闻数据集。我们还训练了基于 transformer 架构的最新 state-of-the-art (SOTA) 语言模型,并证明训练后的模型展现出不错的文本分类性能。所有代码、数据集和训练模型均可在 https://github.com/Kdavid2355/KoPolitic-Benchmark-Dataset 获取。
引用
@article{arxiv.2311.01712,
title = {A New Korean Text Classification Benchmark for Recognizing the Political Intents in Online Newspapers},
author = {Beomjune Kim and Eunsun Lee and Dongbin Na},
journal= {arXiv preprint arXiv:2311.01712},
year = {2023}
}
备注
11 pages