中文

面向复杂基于方面情感分析任务的捷克语数据集

计算与语言 2025-08-12 v1

摘要

本文介绍了一个新的捷克语方面情感分析(Aspect-Based Sentiment Analysis, ABSA)数据集,包含3.1K个手动标注的餐饮领域评论。该数据集基于较早的捷克语数据集构建,后者仅包含针对基本ABSA任务(如方面词提取或方面极性检测)的单独标签。与其前身不同,本新数据集专为更复杂的任务设计,例如目标-方面-类别检测。这些高级任务需要统一的标注格式,无缝地将情感元素(标签)相互链接。我们的数据集遵循广为人知的SemEval-2016数据集格式,这一设计选择允许在跨语言情境下轻松应用和评估,从而促进与其他语言中等效数据集的跨语言比较。标注过程由两位训练有素的标注员完成,实现了约90%的注释员间一致性。此外,我们提供2400万条未标注评论,适用于无监督学习。我们展示了使用各种基于Transformer的模型实现的强大单语言基线结果,并提供了有洞察力的错误分析以补充我们的贡献。我们的代码和数据集均可免费用于非商业科研目的。

关键词

引用

@article{arxiv.2508.08125,
  title  = {Czech Dataset for Complex Aspect-Based Sentiment Analysis Tasks},
  author = {Jakub Šmíd and Pavel Přibáň and Ondřej Pražák and Pavel Král},
  journal= {arXiv preprint arXiv:2508.08125},
  year   = {2025}
}

备注

Published In Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). Official version: https://aclanthology.org/2024.lrec-main.374/