基于古典学语境知识微调大语言模型用于问答
计算与语言
2023-12-14 v1 人工智能
摘要
大型语言模型 (LLMs) 的开源发布为任何理解语言并能使用计算机的人创造了与重要人工智能工具互动的多种可能性,尤其是在学习和知识传播的背景下。然而,这些模型在古典学等专业领域的效用仍基本未被探索。本项目尝试通过微调一个 LLM 来满足学习者和专业人士的特定需求,从而将古典学知识与人工智能的能力相融合。本项目的目标是开发一个 LLM,它不仅能准确地复现语境知识,还能展现出一致的“个性”——并且确实具有一贯的得体性——以吸引拥有不同知识水平的多样化受众。本项目很大一部分工作致力于精炼数据集,遵循“垃圾进,垃圾出”的原则,以确保模型在收到提示(陈述、问题或单个词)时能生成相关、有用且富有创造性的回复。经过训练和评估,我的模型处理大量不同类型输入和提示的能力超出了对一个 3.55 亿参数模型的预期,尽管其偶尔出现的幻觉(尤其是在设置高温度时),特别是关于历史事件或其自身身份的断言,使其显得有些反复无常,未来将进行更多以持续微调为形式的工作。
引用
@article{arxiv.2312.07848,
title = {Finetuning an LLM on Contextual Knowledge of Classics for Q&A},
author = {Shane Storm Strachan},
journal= {arXiv preprint arXiv:2312.07848},
year = {2023}
}
备注
10 pages