大语言模型下的时序文本分类
计算与语言
2026-03-13 v1
摘要
语言随时间变化。计算模型可被训练以识别此类变化,从而估计文本的出版日期。尽管近期在大语言模型(LLM)方面取得了进展,但其在自动文本 dating 上的表现,亦即时序文本分类(TTC),尚未得到探索。本研究在时序文本分类任务上,对领先的专有模型(Claude 3.5、GPT-4o、Gemini 1.5)和开源模型(LLaMA 3.2、Gemma 2、Mistral、Nemotron 4)进行了首次系统评估,所用数据包括三个历史语料库,其中两个为英文,一个为葡萄牙文。我们测试了零样本和少样本提示,以及微调设置。结果表明,专有模型在少样本提示下表现良好;同时也表明,微调显著提升了开源模型的性能,但它们仍未达到专有模型的水平。
引用
@article{arxiv.2603.11295,
title = {Temporal Text Classification with Large Language Models},
author = {Nishat Raihan and Marcos Zampieri},
journal= {arXiv preprint arXiv:2603.11295},
year = {2026}
}