发布日期:2026-08-16 03:29 点击次数:72

AI 自动生成的苹果芯片 Metal 内核J9九游会体育,比官方的还要好?
Gimlet Labs 的最新连续暴露,在苹果建立上,AI 不仅能自动生成 Metal 内核,还较基线内核终确认87%的 PyTorch 推理速率普及。
更惊东谈主的是,AI 生成的 Metal 内核还在测试的 215 个 PyTorch 模块上终确认平均1.87 倍的加快,其中一些责任负载以致比基准快了数百倍。

真就 AI Make 苹果 AI Great Again?
用 AI 为苹果建立生成内核
先说论断:通过 AI 自动终了内核优化,可以在无需修改用户代码、无需新框架或移植的情况下,显耀普及模子性能。
为了评释注解这少许,连续东谈主员登科了来自 Anthropic、DeepSeek 和 OpenAI 的 8 个顶尖模子,让它们为苹果建立生成优化的 GPU 内核,以加快 PyTorch 推理速率。

至于为什么是苹果?别问——问就民众最大硬件供应商(doge)
接下来,让咱们望望连续东谈主员是如何作念的:
实验诞生
发轫,在模子采纳方面,参与测试的模子包括:claude-sonnet-4、claude-opus-4;gpt-4o、gpt-4.1、gpt-5、o3;deepseek-v3、deepseek-r1。
其次,在测试输入方面,连续使用了 KernelBench 数据聚首界说的 PyTorch 模块,并登科了其中 215 个模块进行测试。

这些被登科的模块被分辩为三个品级,分别是第一级的通俗操作(如矩阵乘法、卷积);第二级是由第一级操作构成的多操作序列;第三级是竣工的模子架构(如 AlexNet、VGG)。
再次,在评估见地方面,连续东谈主员主要关爱两个见地:一是 AI 生成内核的正确性,二是其相较于基准 PyTorch 的性能普及。
临了,连续使用的苹果硬件为Mac Studio ( Apple M4 Max chip ) ,Baseline 为PyTorch eager mode(划重心,一会要考)

实验测试
在上述准备完了后,连续团队张开了测试。
测试经由如下:
经受教导(prompt)和 PyTorch 代码;
生成 Metal 内核;
评估其是否在正确性(correctness^4)上与基准 PyTorch 一致;
如若编译失败或不正确,则将造作信息回传给智能体重试,最多允许重试 5 次。
如上所说,连续者发轫关爱 AI 生成内核的正确性。
实验标明,正确性会跟着尝试次数的增多而普及。以o3为例:第一次尝试就有约60%的概率得到可用终了,到第5 次尝试时可用终了比例达到94%。

此外,连续还发现推理模子相等擅长跨层级生成正确的内核,尽管非推理模子偶然也能作念到这少许。

那么,AI 生成的内核发达如何呢?
实验末端详等惊艳,险些每个模子齐生成了一些比基准更快的内核。
举例,GPT-5 在一个 Mamba 25 状况空间模子上终确认4.65 倍的加快,其主要通过内核交融(kernel fusion) 来减少内核调用的支出,并改善内存打听风光。
在一些案例中,o3 以致将延伸普及了当先9000倍!
总体而言,GPT-5 平均可以带来约 20% 的加快,其他模子则过期。

不外,GPT 并非是门门最优,连续东谈主员发现 GPT-5 在34%的问题上生成了最优解。
但在另外30%的问题上,其他模子生成的解比 GPT-5 更优!

这就意味着莫得单一模子能在扫数问题上齐生成最优内核。
因此,如若把多个模子组合起来,就能更大要率生成最优内核。
于是乎,连续东谈主员又张开了智能体群体实验(Agentic Swarm)。
智能体群体实验
未卜先知,相较于单个模子,智能体群体计谋终确认更高的性能普及。
与 GPT-5 比拟,智能体群体在各层级平均加快31%,在 Level 2 问题上加快42%。

在险些莫得高下文信息的情况下(仅有输入问题和教导),智能体群体就仍是发达得相等可以。
接下来,连续东谈主员尝试为智能体提供更多高下文,以获取更快的内核。
这里主要包含两个独特的信息开始:
CUDA 终了(由于 Nvidia GPU 的普及,频频可以获取优化过的 CUDA 参考终了);
M4 上 gputrace 的性能分析信息。 ( 包含 Apple Script 拿获的 gputrace 摘要、内存和期间线视图 )

在具体的实施算作中,连续者先将截图解决任务分派给一个子智能体(subagent),让它为主模子提供性能优化教导。
在收到教导后,主智能体先进行一次初步终了,然后对其进行性能分析和计时。
随后,再将截图传给子智能体以生成性能优化教导。

实验标明,在高下文树立方面也莫得所谓的"单一最好"有缱绻。

不外,在具体的性能加快方面,加入这些独特高下文终确认平均 1.87 倍的加快,相较于平时智能体仅终了的 1.31 倍的平均加快,独特高下文将普及幅度提高了三倍!

有普及,但看跟谁比
为了更长远地连续,咱们有必要先归来一些配景常识。
在 PyTorch 中,咱们频频会调用如 Sequential、ReLU 这么的函数。
在具体的实行中,PyTorch 会先将函数拆解为张量运算(矩阵乘法、加法等),再交给 GPU 实行。
这时就需要 GPU 内核(kernel)厚爱把这些数学操作转成 GPU 可和会的初级并行指示。
因此,在某种进度上,咱们可以说 GPU 内核就像 C 编译器相似,其性能关于运算效果至关遑急。
而上头这篇责任所作念的,即是让本来必须由工程师手写的内核优化交给 AI 自动完成,并测试它的性能。
不外,问题就来了。
家喻户晓,苹果硬件并不像英伟达的 CUDA 相似,对 PyTorch 有很好的优化。
因此,这篇连续径直拿 MPS 后端原生终了和 AI 生成的内查对比是有失公允的。
不少眼尖的网友亦然发现并指出了这少许:著述里所用的 baseline 是 eager mode,这频频只用于熟练调试或见地料想,不会被简直部署到建立上。
在确实部署中,一般会先把模子导出为 ONNX,再编译成建立原生式样(Metal、CUDA 或 ROCm 等),这么效果会比径直用 PyTorch eager mode 高许多。

是以,岂论内核是工程师手写,如故 AI 自动生成,经过优化的 GPU 内核齐会比未优化的 PyTorch 推理快得多。
因此,拿调试过的内核和 eager 比,些许有点奇怪。
对此,连续东谈主员回复谈:
这篇责任不是为了展示部署环境的最终性能极限,而是展示 AI 自动生成内核的可行性。

连续的见地是在内核工程方面获取东谈主类大师一定进度的效益,而无需开辟东谈主员的独特进入,但愿通过 A 将部分经由自动化。
是以,重心不在于性能普及,而在原型考据。
对此,你如何看?
参考纠合
[ 1 ] https://gimletlabs.ai/blog/ai-generated-metal-kernels-content-fn-4
[ 2 ] https://news.ycombinator.com/item?id=45118111
[ 3 ] https://en.wikipedia.org/wiki/Compute_kernel
[ 4 ] https://github.com/ScalingIntelligence/KernelBench/
一键三连「点赞」「转发」「遏止心」
接待在批驳区留住你的思法!
— 完 —
专属 AI 产物从业者的实名社群,只聊 AI 产物最落地的真问题 扫码添加小助手,发送「姓名 + 公司 + 职位」肯求入群~
进群后,你将径直获取:
� � 最新最专科的 AI 产物信息及分析 � �
� � 不按期披发的热点产物内测码 � �
� � 里面专属试验与专科连续 � �
� � 点亮星标 � �
科技前沿进展逐日见J9九游会体育