面向透明性:通过可视化主题建模和语义框架探索 LLM 训练数据集
计算与语言
2024-06-12 v1 人工智能
摘要
大型语言模型(LLM)如今已负责代表人类的做出许多决策,从回答问题到分类事物,它们已成为日常生活中重要的一部分。尽管计算和模型架构在近年来迅速发展,但为训练数据集精心挑选的努力仍处于起步阶段。这种对训练数据集的轻视导致 LLM 创建出偏见和低质量的内容。为解决此问题,我们提出了 Bunka,这是一种利用人工智能和认知科学来改进文本数据集精选的软件。我们展示了如何将主题建模结合二维地图谱图来增加数据集的透明度。我们然后展示了如何将相同的主题建模技术应用于偏好数据集,以加速微调过程并提高模型在不同基准测试中的能力。最后,我们展示了如何通过框架分析获取训练语料库中现有偏见的洞见。总体而言,我们认为需要更好的工具来探索和提高 LLM 训练数据集的质量和透明度。
引用
@article{arxiv.2406.06574,
title = {Towards Transparency: Exploring LLM Trainings Datasets through Visual Topic Modeling and Semantic Frame},
author = {Charles de Dampierre and Andrei Mogoutov and Nicolas Baumard},
journal= {arXiv preprint arXiv:2406.06574},
year = {2024}
}