中文

追踪可信度动态:重新审视大型语言模型的预训练阶段

计算与语言 2024-09-04 v2 人工智能

摘要

确保大型语言模型(LLM)的可信度至关重要。大多数研究集中于完全预训练的LLM,以更好地理解和提升LLM的可信度。在本文中,为揭示预训练的未开发潜力,我们率先探索了LLM在预训练期间的可信度,重点关注五个关键维度:可靠性、隐私性、毒性、公平性和鲁棒性。首先,我们对LLM应用线性探测。高探测准确率表明,\textit{早期预训练阶段的LLM已经能够区分每个可信度维度中的概念}。因此,为进一步揭示预训练的隐藏可能性,我们从LLM的预训练检查点中提取引导向量以增强LLM的可信度。最后,受\citet{choi2023understanding}的启发(互信息估计受线性探测准确率限制),我们还使用互信息探测LLM,以研究预训练期间可信度的动态变化。我们首次观察到类似的两阶段现象:拟合与压缩\citep{shwartz2017opening}。本研究对LLM预训练期间的可信度建模进行了初步探索,旨在揭示新的见解并推动该领域的进一步发展。我们将公开代码,网址为\url{https://github.com/ChnQ/TracingLLM}。

关键词

引用

@article{arxiv.2402.19465,
  title  = {Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models},
  author = {Chen Qian and Jie Zhang and Wei Yao and Dongrui Liu and Zhenfei Yin and Yu Qiao and Yong Liu and Jing Shao},
  journal= {arXiv preprint arXiv:2402.19465},
  year   = {2024}
}

备注

Accepted at ACL 2024