用于情感分析的 BERT:预训练与微调的替代方案
计算与语言
2022-01-11 v1
摘要
BERT 通过启用能够捕捉复杂文本模式的大语言模型迁移学习,革新了 NLP 领域,在大量 NLP 应用中达到了最先进水平(SOTA)。对于文本分类任务,BERT 已被广泛探索。然而,如何更好地处理 BERT 输出层提供的不同嵌入,以及使用特定语言模型而非多语言模型等方面在文献中尚未得到充分研究,尤其是对于巴西葡萄牙语。本文旨在针对聚合 BERT 输出层所产生的特征的不同策略开展广泛的实验研究,重点关注情感分析任务。实验包含使用巴西葡萄牙语语料库训练的 BERT 模型以及多语言版本,涵盖多种聚合策略与具有预定义训练、验证和测试划分的开源数据集,以促进结果的可复现性。与 TF-IDF 相比,BERT 在大多数情况下取得了最高的 ROC-AUC 值。尽管如此,TF-IDF 在预测性能与计算成本之间代表了一种良好的权衡。
引用
@article{arxiv.2201.03382,
title = {BERT for Sentiment Analysis: Pre-trained and Fine-Tuned Alternatives},
author = {Frederico Souza and João Filho},
journal= {arXiv preprint arXiv:2201.03382},
year = {2022}
}
备注
10 pages, 1 figure, 3 tables. Accepted at International Conference on the Computational Processing of Portuguese (PROPOR 2022), but not yet published