语言模型参数越多越好?DeepMind用700亿打败自家2800亿训练优化出“小
2022-04-05 08:26:23
给定固定的 FLOPs 预算,该当奈何衡量模子巨细和操练 token 的数目?DeepMind 得出了与先前差别的结论。
近来一系列大型叙话模子 (LLM) 正正在振兴,此中最大的叙话模子一经具有突出 5000 亿个参数。这些大型自回归 transformer 通过操纵百般评估赞同(比方零样本、少样本和微调),正在很众做事中再现出令人印象深切的功能。
然而操练大型叙话模子需求消磨浩大的推算和能源,而且这种消磨跟着模子的加众而加众。正在施行中,查究者事先分派的操练推算预算一样是预先显露的:有众少加快器可用以及咱们念要操纵它们众长时辰。一样这些大模子只操练一次是可承受的,因而确切揣测给定推算预算的最佳模子超参数至闭紧急。
Kaplan 等人查究 (2020) 声明,自回归叙话模子 (LM) 中的参数数目与其功能之间存正在幂律相干。结果是该周围继续正在操练越来越大的模子,企望功能获得革新。Kaplan 等人(2020) 得出的一个值得贯注的结论是,不该当将大型模子操练到其不妨的最低吃亏,以得到推算的最佳化。
来自 DeepMind 的查究者得出了沟通的结论,但他们揣测大型模子可能操练的 token 数该当比作家保举的更众。完全来说,假安排算预算加众 10 倍,其他查究者提议模子的巨细该当加众 5.5 倍,而操练 token 的数目该当只加众 1.8 倍。相反,DeepMind 察觉模子巨细和操练 token 的数目该当以相当的比例扩展。

继 Kaplan 等人和 GPT-3 的操练筑立查究之后,近期大型模子的操练 token 大约为 3000 亿个(外 1),这与加众算力时,首要采用加众模子巨细结论划一。

正在这项事业中,DeepMind 从新审视了这个题目:给定固定的 FLOPs 预算,该当奈何衡量模子巨细和操练 token 的数目?为了回复这个题目,DeepMind 将最终的预操练吃亏 ��(��, ��) 筑模为模子参数数目 �� 和操练 token 数目 �� 的函数。因为推算预算 �� 是所睹操练 token 和模子参数数目确凿定性函数 FLOPs(��, ��),因而可能正在桎梏 FLOPs(��, ��) = �� 下最小化��:

DeepMind 遵循 400 众个模子的吃亏揣测了这些函数,参数边界从 70M 到 16B 以上,并正在 5B 到 400B 众个 token 长进行操练——每个模子设备都针对几个差别的操练边界实行操练。结果声明 DeepMind 本领得出的结果与 Kaplan 等人的结果大不沟通,如下图 1 所示:

基于 DeepMind 揣测的推算最优边境,他们预测用于操练 Gopher 的推算预算,一个最优模子该当是模子巨细比之前小 4 倍,而操练的 token 该当是之前的 4 倍众。
为了声明这一点,DeepMind 操练了一个更优推算的 70B 模子 Chinchilla,具有 1.4 万亿个 token。Chinchilla 不只功能优于模子更大的 Gopher,况且其减小的模子尺寸大大下降了推理本钱,并极大地推进了正在较小硬件上的下逛操纵。大型叙话模子的能源本钱通过其用于推理和微调的用处来摊销。因而,始末更优化操练的较小模子的好处,跨越了其功能革新的直接好处。
特斯拉人工智能和自愿驾驶视觉总监 Andrej Karpathy 外现:Chinchilla 是一个新的叙话模子(70B),它优于 Gopher (280B), GPT-3 (175B), Jurrasic-1 (178B), MT-NLG (530B) 大模子。这是闭于叙话模子(LM)新的扩展定律格外紧急的论文。

查究者提出三种差别的本领来解答饱吹本项查究的题目:给定固定的 FLOPs 预算,该当奈何衡量模子巨细和操练 tokens 的数目?正在全部三种境况下,查究者最初操练了一系列参数和操练 tokens 都差别的模子,并操纵得出的操练弧线来拟合模子扩展的体味揣测器(empirical estimator)。
三种本领的预测结果肖似,声明模子参数和操练 tokens 的数目该当跟着推算量的加众而加众,比比方下外 2 所示。这与以前相闭该主旨的事业酿成显然对照,值得进一步查究。

对待第一种本领,查究者变更了固定参数模子(从 70M 到 10B 参数)的操练步数,为每个模子操练了 4 个差别数目的操练序列。运转之后,他们也许直接提取给定操练 FLOPs 所抵达的最小吃亏的揣测值。操练弧线:IsoFLOP

正在第二种本领中,查究者针对 9 种差别的操练 FLOP(从 6 × 10^18 到 3 × 10^21 FLOPs)变更模子巨细,并切磋到了每个点的最终操练吃亏。与本领 1 全盘操练运转中切磋点(��, ��, ��)酿成了对照,这使得直接回复以下题目:对待给定的 FLOP 预算,最优参数数目是众少?下图 3 为 IsoFLOP 弧线:拟合一个参数吃亏函数

末了,查究者将本领 1 和 2 中实习的全部最终吃亏筑模为一个包罗模子参数和可睹 tokens 数目的参数函数。坚守经典的危机领悟,他们提出了如下函数情势:为了揣测(��, ��, ��, ��, ��),查究者操纵 L-BFGS 算法来最小化预测和旁观到对数吃亏(log loss)之间的 Huber 吃亏。他们通过从初始化网格入选择最佳拟合来切磋不妨的部分最小值。Huber 吃亏(�� = 10^−3)对特殊值具有鲁棒性,这点对待留出数据点告竣优越预测功能格外紧急。
查究者察觉,以上三种本领只管操纵了差别的拟合计划和差别的操练模子,但对相闭 FLOPs 的参数和 tokens 的最优扩展发作了可比拟的预测。它们都外清楚,跟着推算预算的加众,模子巨细和操练数据量该当以大致沟通的比例加众。此中,第一种和第二种本领对最优模子巨细的预测格外相同,第三种本领正在更众推算预算下也许最优地预测更小模子。
不才外 3 中,查究者揭示了 FLOPs 和 tokens 的揣测量,以确保给定巨细的模子位于推算最优边境上。结果声明,切磋到各自的推算预算,方今一代的大领域叙话模子「过于大了」。

遵循上文的分解,Gopher 模子的最优模子巨细介于 40B 到 70B 参数之间。出于数据集和推算效能的切磋,查究者操练了一个 70B 参数、1.4T tokens 的模子,称之为 Chinchilla,并与 Gopher 和其他大领域叙话模子实行了比拟。贯注,Chinchilla 和 Gopher 的操练 FLOPs 沟通,但模子巨细和操练 tokens 差别。
因为 Chinchilla 的参数目为 Gopher 的 1/4,因此它的内存占用和推理本钱更小。
Chinchilla 的操练超参数及其与 Gopher 的比拟如下外 4 所示。两者操纵了沟通的模子架构和操练筑立,但正在 head 数目、批巨细等方面有所差别。

查究者对 Chinchilla 实行了寻常的评估,与百般大领域叙话模子正在 Rae et al. (2021)提出的许众做事上睁开了比拟。这些做事席卷叙话筑模(LM)、阅读通晓、问答、常识、MMLU 和 BIG-bench,完全如下外 5 所示。叙话筑模做事。如下图 5 所示,Chinchilla 正在 The Pile 的全部评估子集上均明显优于 Gopher。众做事叙话通晓(MMLU)做事。大领域 MMLU 基准测试包罗一系列与学科肖似的考查题目。不才外 6 中,查究者揭示了 Chinchilla 正在 MMLU 上的均匀 5-shot 功能。可能看到,只管领域小得众,但 Chinchilla 显明优于 Gopher,均匀确切率为 67.6%,比 Gopher 提升了 7.6%。而且,Chinchilla 确凿切率以至突出了 2023 年 6 月专家预测的 63.4% 。

正在图 6 中,DeepMind 揭示了按做事细分结果与 Gopher 的比拟。总的来说,查究察觉 Chinchilla 提升了绝大无数做事的功能。正在四个做事(college_mathematics、econometrics、moral_scenarios 和 formal_logic)上,Chinchilla 的再现不如 Gopher,而且正在两个做事上的再现没有转折。

阅读通晓。正在单词预测数据集 LAMBADA 上,Chinchilla 抵达了 77.4% 确凿切率,而 Gopher 和 MT-NLG 530B 确凿切率区别为 74.5% 和 76.6%(睹外 7)。正在 RACE-h 和 RACE-m 上,Chinchilla 的功能大大优于 Gopher,两种境况下确凿切率都提升了 10% 以上。

BIG-bench。DeepMind 正在 BIG-bench 做事上评估了 Chinchilla,与 MMLU 中旁观到的境况肖似,Chinchilla 正在众项做事上优于 Gopher。
原题目:《叙话模子参数越众越好?DeepMind用700亿击败自家2800亿,操练优化出「小」模子》