揭示大语言模型在时间数据上的不同归纳偏差
计算与语言
2024-04-03 v1 人工智能
摘要
揭示自然语言中事件的复杂细节需要对时间动态有微妙的理解。尽管大语言模型(LLMs)在从数据中辨别模式和关系方面表现出色,但它们对时间动态的内在理解仍然是一个艰巨的挑战。本研究细致地探索了LLMs中的这些内在挑战,特别侧重于评估GPT-3.5和GPT-4模型在时间数据分析中的性能。采用两种不同的提示类型,即问答(QA)格式和文本蕴含(TE)格式,我们的分析探究了隐式和显式事件。结果突显了值得注意的趋势,揭示了GPT-3.5和GPT-4性能的差异。值得注意的是,对特定时间关系的偏好显现出来,GPT-3.5在QA格式中对于隐式和显式事件都表现出对“AFTER”的偏好,而GPT-4则倾向于“BEFORE”。此外,出现了一致的模式,GPT-3.5倾向于“TRUE”,而GPT-4在TE格式中对于隐式和显式事件都表现出对“FALSE”的偏好。GPT-3.5和GPT-4在处理时间数据上的这种持续差异突显了LLMs中归纳偏差的复杂性质,表明这些模型的演化可能不仅不会减轻偏差,反而可能引入新的复杂性层次。
引用
@article{arxiv.2404.01453,
title = {Unveiling Divergent Inductive Biases of LLMs on Temporal Data},
author = {Sindhu Kishore and Hangfeng He},
journal= {arXiv preprint arXiv:2404.01453},
year = {2024}
}