
机器之心报谈kaiyun体育
剪辑:泽南、小舟
租用 H100 的钱只需 233 好意思元。
还谨记 Andrej Karpathy 纯 C 说话复现 GPT-2 大模子的姿色吗?
本年 4 月,AI 范围大牛 Karpathy 一个仅用 1000 行代码即可在 CPU/fp32 上杀青 GPT-2 考验的姿色「llm.c」已经激励机器学习社区的厉害盘考。
llm.c 旨在大幅简化大模子的考验,ta 使用纯 C 说话 / CUDA,不需要 245MB 的 PyTorch 或 107MB 的 cPython。不外即使是这么的优化,复现 GPT-2 级别的模子也需要在 8 块 H100 上破耗 45 分钟进行考验。
没思到几个月当年,业界水平确切有了指数级的耕作,让 Karpathy 本东谈主王人感到咋舌:

在 GitHub 上出现了一个新姿色「Modded-NanoGPT」,对期间进行了大幅度的迭代,面前杀青换取的适度只需要 5 分钟。该辩论的作家 Keller Jordan 曾在 Hive AI 责任,一直以来的辩论方针王人防护于模子考验的优化。他在本周三默示,利器具有大序列长度的 FlexAttention,他已把速率的记载从 7.2 分钟耕作到了 5 分钟。

面前有了 FlexAttention 和较大的 seqlen,文档的拆分更少了,因此说话建模在考验和考证时王人变得更容易。该记载在 HellaSwag 上的准确率略有缩小,约为 29%,而之前的记载和 Andrej Karpathy 的原始考验准确率约为 30%。
让咱们望望他是怎么作念的:

姿色鸠合:https://github.com/KellerJordan/modded-nanogpt/tree/master
Modded-NanoGPT
该姿色名为「Modded-NanoGPT」,它是 llm.c 存储库的 PyTorch GPT-2 考验器的篡改变体:
10B tokens-->1B tokens8xH100 上花 45 分钟考验 -->8xH100 上花 5 分钟考验
Modded-NanoGPT 弃取如下期间:
先进的架构:旋转镶嵌、QK-Norm 和 ReLU^2;新优化器:Muon;镶嵌中的 Untied Head;投影和分类层开动化为零(muP-like);架构 shortcut:值残差和镶嵌 shortcut(部分罢免论文《Value Residual Learning For Alleviating Attention Concentration In Transformers》);动量(Momentum)warmup;Tanh soft logit capping(罢免 Gemma 2);FlexAttention。
要进行考验,请运行以下三个敕令:
pip install -r requirements.txtpip install--pre torch --index-url https://download.pytorch.org/whl/nightly/cu124 —upgrade # install torch 2.6.0python data/cached_fineweb10B.py 10# downloads only the first 1.0B training tokens to save time./run.sh
在蚁合鸠合精致的 8xH100 上,考验应在 20 分钟内完成。
适度将是一个具有 124M 活跃参数的 transformer,在 10 亿 Fineweb tokens 上考验了 1875 steps,杀青了约 3.278 的考证亏损。比较之下,默许的 llm.c PyTorch 考验器在 100 亿 tokens 上考验了 19560 steps 后,考证亏损 >3.28。
值得一提的是,要在更少的 GPU 上运行 Modded-NanoGPT,只需修改 run.sh 以赢得不同的 --nproc_per_node。淌若内存不及,只需在 train_gpt2.py 中将 device_batch_size 削弱到 16 或 32。
这里有一个适用于全新 8xH100 实例的启动剧本:
sudo apt-get updatesudo apt-getinstall vim tmux python3-pip python-is-python3 -ygit clone https://github.com/KellerJordan/modded-nanogpt.gitcd modded-nanogpttmuxpip install numpy==1.23.5 huggingface-hub tqdmpip install--upgrade torch &python data/cached_fineweb10B.py 18
淌若 CUDA 或 NCCL 版块与你现时的系统成就不兼容,Docker 不错成为一种灵验的替代决议。这种情势门径化了 CUDA、NCCL、CUDNN 和 Python 的版块,减少了依赖性问题并简化了成就。精明:系统上必须已装配 NVIDIA 驱动法子。
sudo docker build -t modded-nanogpt .sudo docker run -it --rm --gpus all -v $(pwd):/modded-nanogpt modded-nanogpt python data/cached_fineweb10B.py 18sudo docker run -it --rm --gpus all -v $(pwd):/modded-nanogpt modded-nanogpt sh run.sh
有一个问题在于,NanoGPT 考验很快是很好,但它可能无法彭胀,仅仅过拟合了 val 亏损?Keller Jordan 默示,这很难反驳,因为「按范围」是一个无尽类别(淌若这些情势对 >100T 的模子就不生效了怎么办?),因此无法彻底解说。此外,作家也原意快速运行中使用的一些情势不太可能彭胀。但淌若读者温煦 1.5B 模子,他们可能会被这个适度劝服:
径直将快速运行(10/18/24 版块)彭胀到 1.5B 参数不错得到一个具有 GPT-2(1.5B)级 HellaSwag 性能的模子,它要比 Karpathy 的基线低廉 2.5 倍(233 好意思元对比 576 好意思元):


Muon optimizer
除了在前东谈主的肩膀上探索,新姿色也使用了 Keller Jordan 自研的优化姿色。比如这个 Muon 优化器,据他所说是面前已知最快的优化器,适用于包括 CIFAR-10 和 GPT-2 范围说话建模在内的多样考验场景。
Muon 的界说如下:

其中 NewtonSchulz5 是 Newton-Schulz 之后的迭代,它类似地用 U @ V.T 替换 G,其中 U, S, V = G.svd ()。
@torch.compiledefzeroth_power_via_newtonschulz5 (G, steps=5, eps=1e-7):assertlen (G.shape) == 2a,b, c = (3.4445, -4.7750, 2.0315)X = G.bfloat16 () / (G.norm () + eps)ifG.size (0) > G.size (1):X = X.T for_ in range (steps):A = X @ X.TB = b * A + c * A @ AX = a * X + B @ XifG.size (0) > G.size (1):X = X.T returnX.to (G.dtype)
关于这种考验场景,Muon 具有以下成心特质:
内存使用量比 Adam 低采样效果提高约 1.5 倍挂钟支出小于 2%
归来
作家默示,生成此优化器的好多弃取王人是通过追求 CIFAR-10 快速运行而通过实验赢得的。其中值得一提的教诲包括:
在更新中使用 Nesterov 动量,在动量之后运用正交化。使用特定的五次 Newton-Schulz 迭代当作正交化情势。使用五次多项式的非管理所有这个词以最大化零处的斜率,从而最小化必要的 Newton-Schulz 迭代次数。事实解说,方差履行上并不那么蹙迫,因此咱们最终得到一个五次多项式,它在重迭运用后(快速)管理到 0.68、1.13 的范围,而不是到 1。在 bfloat16 中运行 Newton-Schulz 迭代(而 Shampoo 杀青频繁依赖于在 fp32 或 fp64 中运行的逆 pth 根)。
使用 Newton-Schulz 迭代进行正交化的情势不错回首到 Bernstein & Newhouse (2024),他们建议将其当作联想 Shampoo 预治理器的情势,并从表面上探索了莫得预治理器蕴蓄的 Shampoo。Keller Jordan 罕见感谢了论文作家之一 Jeremy Bernstein 的协助。
淌若咱们在这里使用 SVD 而不是 Newton-Schulz 迭代,那么这个优化器就会因为太慢而无法使用。Bernstein & Newhouse 还指出,莫得预治理器蕴蓄的 Shampoo 绝顶于谱范数中的最陡下落,因此 Shampoo 不错被合计是一种平滑谱最陡下落的情势。所提议的优化器不错被合计是平滑谱最陡下落的第二种情势,与 Shampoo 比较,它具有不同的内存和运行时量度。
XINWENZHONGXIN
(原标题:2025年9月19日武威昊天农居品交往商场暨仓储物流中心价钱行情) 品种 最高价 最廉价 大量价 大米 6.40 6.00 6.20 特一粉 4.00 3.50 3.70 糯米 7.00 6.60 6.80 大白菜 1.20 0.80 1.00 甘蓝 1.00 0.70 0.80 油菜 2.00 1.60 1.80 小白菜 2.00 1.60 1.80 生菜 6.00 5.60 5.80 菠菜 4.00 3.60 3.80 茼蒿 2.40 2.00 2.20 香菜 3.20 2.80
(原标题:2025年9月19日江苏丰县农业农村局价钱行情) 品种 最高价 最廉价 大量价 油菜 7.00 6.00 7.00 生菜 10.00 8.00 9.00 菠菜 14.00 11.00 12.00 茼蒿 9.00 7.00 8.00 香菜 12.00 8.00 10.00 油麦菜 10.00 9.00 9.00 韭菜 7.00 5.00 6.00 土豆 3.00 1.60 2.60 山药 6.00 5.00 5.60 葱头 2.00 1.20 1.80 生姜 9.00 7.00 8.0
(原标题:2025年9月19日武汉白沙洲农副居品大市集有限公司价钱行情) 品种 最高价 最廉价 巨额价 籼米(晚籼米) 4.40 4.20 4.30 粳米(庸俗) 4.20 4.00 4.10 大白菜 2.40 1.80 2.10 油菜 5.00 4.50 4.75 生菜 6.80 6.00 6.40 菠菜 10.00 9.00 9.50 苋菜 5.50 5.00 5.25 香菜 9.00 8.00 8.50 油麦菜 5.60 5.00 5.30 空腹菜 4.50 3.50 4.00 韭菜 7
格隆汇9月9日|韩国总统照应人:韩好意思买卖推敲因“3500亿好意思元赴好意思投资有运筹帷幄对汇率市集的影响”而堕入延长。已明确奉告好意思方,韩国无法剿袭与日本“5500亿好意思元对好意思投资条约”同样的条件。 (包袱裁剪:宋政 HN002) 【免责声明】本文仅代表作家本东说念主不雅点,与和讯网无关。和讯网站对文中述说、不雅点判断保抓中立,不合所包含试验的准确性、可靠性或圆善性提供任何昭示或清晰的保证。请读者仅作参考,并请自行承担整个包袱。邮箱:news_center@staff.he
中国经济网北京9月9日讯 晶升股份(688478.SH)午间收报39.05元,跌6.56%,盘中最廉价报36.50元,跌幅12.66%。 公司昨晚裸露对于裸露刊行股份及支付现款购买金钱并召募配套资金暨关联交游预案的一般风险指示暨公司股票复牌的公告,公司拟通过刊行股份及支付现款的姿色购买北京为准智能科技股份有限公司的法例权,同期召募配套资金。把柄上交所推敲章程,经公司苦求,公司股票于2025年8月26日(星期二)开市起停牌;经苦求,公司股票将于2025年9月9日(星期二)开市起复牌。 公司同日裸