基于 LSTM 的文本生成:历史数据集研究
计算与语言
2024-03-13 v1 人工智能
摘要
本文探讨了长短期记忆(LSTM)网络在文本生成领域的应用,重点是利用莎士比亚和尼采的历史数据集。LSTM 以其处理序列数据的有效性而闻名,此处被用于建模历史文本中固有的复杂语言模式和结构。研究表明,基于 LSTM 的模型在历史数据集上训练后,不仅能生成语言丰富且语境相关的文本,还能提供对语言模式随时间演变的洞察。研究结果显示,该模型在预测尼采作品文本时具有极高的准确性和效率,损失值低,训练时间为 100 次迭代;模型准确率为 0.9521,表明其高精度;模型损失为 0.2518,表明其有效性。在预测莎士比亚作品文本时,模型准确率为 0.9125,表明误差率较低;模型训练时间同样为 100 次,反映了与尼采数据集相当的效率。这种效率证明了模型设计和训练方法的有效性,特别是在处理复杂文学文本时。本研究通过展示 LSTM 网络在文本生成中的多功能性,并为历史语言学及更广泛领域的未来探索提供途径,从而为自然语言处理领域做出了贡献。
引用
@article{arxiv.2403.07087,
title = {LSTM-Based Text Generation: A Study on Historical Datasets},
author = {Mustafa Abbas Hussein Hussein and Serkan Savaş},
journal= {arXiv preprint arXiv:2403.07087},
year = {2024}
}