机器生成的产品广告:基准测试LLM与人类性能
计算与语言
2024-12-30 v1
摘要
本研究比较了AI生成和人类编写的产品描述的性能,使用多层次评估模型。我们分析了为100个产品由四个AI模型(Gemma 2B、LLAMA、GPT2和ChatGPT 4)生成的描述,这些模型分别带和不带示例描述,针对人类编写的描述进行评估。我们的评估指标包括情感、可读性、说服力、搜索引擎优化(SEO)、清晰度、情感吸引力以及行动号召效果。结果表明,ChatGPT 4性能最佳。相比之下,其他模型表现出显著的不足,产生不连贯且毫无逻辑的输出,缺乏逻辑结构和上下文相关性。这些模型在保持对所描述产品的关注方面存在挑战,导致句子不连贯,无法传递有意义的信息。该研究为了解AI在电子商务内容创建方面的当前能力和局限性提供了见解。
引用
@article{arxiv.2412.19610,
title = {Machine Generated Product Advertisements: Benchmarking LLMs Against Human Performance},
author = {Sanjukta Ghosh},
journal= {arXiv preprint arXiv:2412.19610},
year = {2024}
}