研究:2019 至 2025 年預訓練效率提升主要歸功於數據改進
Dwarkesh Patel 與 Jerry Han 的研究指出,2019 至 2025 年間預訓練效率的提升,數據改進的貢獻約為模型改進的 3.24 倍。在 1e19 FLOPs 的計算預算下,數據改進帶來的效率增益為 12 倍,而模型改進為 3.7 倍。研究顯示數據與模型改進的效應大體獨立,數據質量從早期的 OpenWebText 演進至更精細的 UltraFineWeb,是推動預訓練進展的核心因素。
摘要由 AI 依據原文撰寫,並非投資建議。