自然语言处理的预训练-微调范式教程
计算与语言
2024-08-05 v3 人工智能
摘要
鉴于自然语言作为表达思想和情感的主要载体,文本分析已成为心理学研究中的关键技术。它使我们能够从自然语言中提取宝贵见解,促进诸如人格特征评估、心理健康监测和人际沟通情感分析等 endeavor。 在文本分析中,现有研究常常采用人工编码方式,耗时;或使用预建词典,往往无法覆盖所有可能情景;或从头训练模型,需要大量标记数据。在本教程中,我们介绍预训练-微调范式。预训练-微调范式代表了文本分析和自然语言处理中的变革性方法。该范式通过使用大型预训练语言模型,展示出即使在有限训练数据下的微调任务的显著效率。这一效率在社会科学研究中尤为有益,后者常常样本数有限。在本教程中,我们首先深入探讨预训练和微调的基本概念,随后进行使用真实应用的实践练习。我们展示了该范式在各种任务上的应用,包括多类分类和回归。强调其有效性和用户友好性,教程旨在鼓励更广泛地采用这一范式。为此,我们提供了所有代码和数据集的公开访问。该教程在各种心理学学科领域都有帮助,为在多样化的研究环境中应用文本分析提供了全面指南。
引用
@article{arxiv.2403.02504,
title = {A Tutorial on the Pretrain-Finetune Paradigm for Natural Language Processing},
author = {Yu Wang and Wen Qu},
journal= {arXiv preprint arXiv:2403.02504},
year = {2024}
}
备注
29 pages, 6 figures, 3 tables