vlog
← 返回全部文章

Tech

标称 22 微法,加上电压只剩 11.4 微法:AI 画的电路代码编译全过,接上仿真 0.85 毫秒就掉电

2026年9月6日 · 保罗·格雷厄姆《黑客与画家》~2 min read

ngspice 的波形图上,5 V 电源在零点掉下去,受保护的那条母线跟着往下滑,0.85 毫秒后跌破 3 V。题目要它撑 20 毫秒。这份电路是模型写的,源码构建成功,没报一个错。

30 秒读懂
1量法

不让模型点鼠标,让电路先变成一份能跑的代码

起因是前一天 OpenAI 发了 GPT-6 Astra,首页演示它在 KiCad 里操作电路板。

atopile 团队的问题很朴素:AI 做出来的电路到底好不好,拿什么量?他们没让模型去图形 CAD 里点鼠标。你别看那演示热闹,模型的上下文大半耗在坐标、菜单、界面状态上。他们把电路写成声明式代码(atopile 自家的语言),模型直接改元件、连接和电气约束,然后构建、仿真、看哪一步倒下。

判卷全程是确定性的:构建设计,生成电路图和 BOM,跑一组 SPICE 仿真和设计检查。每条要求对应一个带上下限的测量值。技术分之上再叠成本效率,对照参考 BOM 算账,团队原话大意是,电路先能用,成本才算分。元件用真实厂商型号,规格从数据手册抽进 SPICE 模型,还要求真能买到、价格合理。

打个比方

给编程代理配一个编译器和一套测试,EEBench 干的是同一件事,只是测试量的东西换了:从「返回值等不等于 42」换成「母线电压什么时候跌破 3 V」。编译器管语法,仿真器管物理,两道关一道都跳不过去。

2掉电

标称 22 微法,加上 4.7 V 只剩 11.4 微法,题目要的是 545 微法

公开题之一是住宅电表,考的就是断电那一瞬。

题目这么设:5 V 供电消失后,电路得让处理器再活 20 毫秒去保存读数,受保护的母线不能低于处理器 3.0 V 的欠压阈值。多数模型的直觉是对的:加电容。说白了这是本科电路课的题。

做出来是另一回事。真实陶瓷电容一加上直流电压,有效电容会掉得远低于标称,还得算容差。一份提交用的是标称 22 µF,判卷器在 4.7 V 偏压下只量到 11.4 µF 有效电容,需求是 545 µF,差了将近五十倍。源码构建成功,电路照样不干活,ngspice 的输出显示母线 0.85 毫秒后就跌破 3 V。一味加大电容也不行:更贵、更占板子,复电后母线恢复更慢。

2007 年我入行第一个活是政务大厅的排队叫号系统,代码在屏幕上一点毛病没有,验收那天喇叭把「请 A052 号到 3 号窗口」念成一串连读,全厅哄笑。判卷的从来是喇叭里那一声。电容这道题里,喇叭换成了 ngspice。

核心

22 µF 是数据手册封面上的数,11.4 µF 是加上 4.7 V 之后剩下的数。模型知道前者,判卷器只认后者。「编译通过」和「电路能用」中间隔着的,就是这两个数的差。

Rated 22 µF, only 11.4 µF under bias: the code built, the rail died at 0.85 msCAPACITOR ACCOUNT · 20 ms HOLD-UPlog scale · 1–1000 µFRequired for 20 ms hold-up545 µFNominal part chosen22 µFEffective at 4.7 V bias11.4 µF1101001000 µFrail falls below 3.0 V at 0.85 msLEADERBOARD · SEPT 1 · 13 PROBLEMSClaude Opus 561.6%Grok 4.657.1%Claude Fable 5.156.4%Claude Fable 554.3%Claude Opus 4.8 Max51.4%GPT-5.542.3%GPT-5.6 Sol39.4%0%100%Graded by deterministic ngspice simulation; V1 does not cover PCB layout or manufacturing.
Source: EEBench blog, atopile team, Sept 4, 2026. Code that builds is not a circuit that works: the chosen 22 µF part delivers only 11.4 µF under bias, far short of the 545 µF a 20 ms hold-up needs, and the rail drops below 3.0 V at 0.85 ms.
3榜单

9 月 1 日榜单:最好的模型六成出头,GPT-6 Astra 还没成绩

团队自己说,几个月前没想到模型能做到这么好。

Claude Opus 5
61.6%
Grok 4.6
57.1%
Claude Fable 5.1
56.4%
Claude Fable 5
54.3%
Claude Opus 4.8 Max
51.4%
GPT-5.5
42.3%
GPT-5.6 Sol
39.4%

EEBench V1,13 道模拟加数字题,SPICE 仿真判分;atopile 团队自付跑分费用,不卖分数。GPT-6 Astra 尚无成绩。

这榜有边界:V1 只评到仿真这一层,不评 PCB 布局、制造和整机点亮,后续想加。13 道题也不多,更难的一道模拟题是围绕运放合成多反馈低通滤波器:解 RC 比例定极点,所有元件推到最坏容差角,增益、截止频率、Q 值还得在限内。

xAI 把 EEBench 写进了 Grok 4.6 的模型卡「工程加速」一节,跟 3D 建模、参数化 CAD 并列,自测 60.0%(xhigh 推理强度),并称在 CAD 这类环境里做了 RL 训练。马斯克说 Grok 4.7 数周内发布,拿 SpaceX 数据加训工程能力,时间可能变。评测方自己掏钱跑分、厂商主动往模型卡里写,这块画布开始有人认了。

4顶嘴

一次失败的运行里有信息,「原理图看着合理」里没有

同一套判卷器倒过来用,就是 RL 的奖励信号。

格雷厄姆在《黑客与画家》里讲,画家看得见画布,边画边改;黑客的反馈来自把程序跑起来。反馈回路要顶用,得即时,还得诚实。一次失败的运行里装的东西不少:哪条电压超限、哪个工作角失败、有没有用不必要的贵方案。团队说这比「模型自己说原理图看着合理」多得多,他们正跟前沿实验室合作,提供更大的评测套件和仿真训练环境。

旧办法

模型出一张原理图,人看一眼,觉得合理就过。模型说得越像越容易过。

新办法

构建、仿真、逐条量电压和元件行为,失败的那一步带着数字回来。说得再像也过不了 3 V 那条线。

2024 年我给 SaaS 登录页接过一个免费的第三方防刷脚本,阿坤在微信上抱怨后台一开他笔记本风扇就起飞。我起先不信,开着任务管理器把页面晾了一小时,GPU 占用每三十来秒跳一下,是脚本在反复跑 canvas 指纹。代码我读过,没觉得哪不对;风扇不看代码,只看功耗。物理层就是这么个裁判,不听你解释。

HN 上的争论也在这条线上。krupan 问:我们从没对人类工程师做过这种规模的测量和反馈回路,为什么?dubbie99 说 AI 整理元件库、核封装、管 BOM 很好用,原理图和布板还是自己画,它犯太多蠢错,但让它复查能抓到人漏掉的。CyLith 让 Claude Opus 4.8 设计一块只用 74 系列逻辑和 GAL、把 EEPROM 图像输出到 VGA 的板子,自己布线,JLC 打样 6 美元,回来有一处错没抓到,飞一根线就能用。cmiles8 说聊选型有帮助,真让它设计板子每次都惨败。amelius 盯着下一个痛点:从 Digikey、LCSC 选料找替代,前提是模型真能读数据手册。合起来看,模型现在像个刚进厂的应届生,跟着老师傅复查、跑腿查料没问题,独立出图还得有人兜底。

5带走

这对你意味着什么:先给它一块会顶嘴的画布,再谈它会不会

团队的结论很克制。

大意是:对一批有用、还在增多的电路问题,答案已经是「能」;但我们还不会让它设计心脏起搏器然后闭着眼装上。AI 会不会电子学,这问题眼下没多少讨论价值,它嘴上什么都会。值得问的是你手头有没有不听解释的裁判:测试、仿真、真机、用户,随便哪个,认结果不认说法。

⚡

为什么值得看:EEBench 把「构建成功」和「电路能用」拆成两个数分开算。前一个数模型几乎都拿得到,后一个数眼下最好的也只有 61.6%。

标称 22 微法,加上电压只剩 11.4 微法。模型说得再像,也得加上电压再算分。

取材声明:本文思想框架取材自保罗·格雷厄姆《黑客与画家》(画家看得见画布、边画边改,黑客靠运行程序获得反馈);事件与数字出自 atopile 团队 2026 年 9 月 4 日 EEBench 博客《Can AI design circuit boards yet?》、xAI Grok 4.6 模型卡及 Hacker News 公开讨论,英文引述为中文大意,细节以原始博客为准。本文为技术科普解读。

技术

标称 22 微法,加上电压只剩 11.4 微法:AI 画的电路代码编译全过,接上仿真 0.85 毫秒就掉电

2026年9月6日 · 保罗·格雷厄姆《黑客与画家》约 6 分钟

ngspice 的波形图上,5 V 电源在零点掉下去,受保护的那条母线跟着往下滑,0.85 毫秒后跌破 3 V。题目要它撑 20 毫秒。这份电路是模型写的,源码构建成功,没报一个错。

30 秒读懂
1量法

不让模型点鼠标,让电路先变成一份能跑的代码

起因是前一天 OpenAI 发了 GPT-6 Astra,首页演示它在 KiCad 里操作电路板。

atopile 团队的问题很朴素:AI 做出来的电路到底好不好,拿什么量?他们没让模型去图形 CAD 里点鼠标。你别看那演示热闹,模型的上下文大半耗在坐标、菜单、界面状态上。他们把电路写成声明式代码(atopile 自家的语言),模型直接改元件、连接和电气约束,然后构建、仿真、看哪一步倒下。

判卷全程是确定性的:构建设计,生成电路图和 BOM,跑一组 SPICE 仿真和设计检查。每条要求对应一个带上下限的测量值。技术分之上再叠成本效率,对照参考 BOM 算账,团队原话大意是,电路先能用,成本才算分。元件用真实厂商型号,规格从数据手册抽进 SPICE 模型,还要求真能买到、价格合理。

打个比方

给编程代理配一个编译器和一套测试,EEBench 干的是同一件事,只是测试量的东西换了:从「返回值等不等于 42」换成「母线电压什么时候跌破 3 V」。编译器管语法,仿真器管物理,两道关一道都跳不过去。

2掉电

标称 22 微法,加上 4.7 V 只剩 11.4 微法,题目要的是 545 微法

公开题之一是住宅电表,考的就是断电那一瞬。

题目这么设:5 V 供电消失后,电路得让处理器再活 20 毫秒去保存读数,受保护的母线不能低于处理器 3.0 V 的欠压阈值。多数模型的直觉是对的:加电容。说白了这是本科电路课的题。

做出来是另一回事。真实陶瓷电容一加上直流电压,有效电容会掉得远低于标称,还得算容差。一份提交用的是标称 22 µF,判卷器在 4.7 V 偏压下只量到 11.4 µF 有效电容,需求是 545 µF,差了将近五十倍。源码构建成功,电路照样不干活,ngspice 的输出显示母线 0.85 毫秒后就跌破 3 V。一味加大电容也不行:更贵、更占板子,复电后母线恢复更慢。

2007 年我入行第一个活是政务大厅的排队叫号系统,代码在屏幕上一点毛病没有,验收那天喇叭把「请 A052 号到 3 号窗口」念成一串连读,全厅哄笑。判卷的从来是喇叭里那一声。电容这道题里,喇叭换成了 ngspice。

核心

22 µF 是数据手册封面上的数,11.4 µF 是加上 4.7 V 之后剩下的数。模型知道前者,判卷器只认后者。「编译通过」和「电路能用」中间隔着的,就是这两个数的差。

标称 22 微法,加压只剩 11.4 微法:代码编译过了,母线 0.85 毫秒就掉了电容账 · 20 毫秒维持对数刻度 · 1–1000 微法20 毫秒维持所需545 微法所选器件标称值22 微法4.7 伏偏压下有效值11.4 微法1101001000 微法母线 0.85 毫秒跌破 3.0 伏9 月 1 日榜单 · 13 道题Claude Opus 561.6%Grok 4.657.1%Claude Fable 5.156.4%Claude Fable 554.3%Claude Opus 4.8 Max51.4%GPT-5.542.3%GPT-5.6 Sol39.4%0%100%判卷为确定性 ngspice 仿真;V1 不评 PCB 布局与制造。
来源:EEBench 博客,atopile 团队,2026 年 9 月 4 日。代码构建成功不等于电路能用:所选 22 微法器件在偏压下只剩 11.4 微法,远低于 20 毫秒维持所需的 545 微法,母线在 0.85 毫秒跌破 3.0 伏。
3榜单

9 月 1 日榜单:最好的模型六成出头,GPT-6 Astra 还没成绩

团队自己说,几个月前没想到模型能做到这么好。

Claude Opus 5
61.6%
Grok 4.6
57.1%
Claude Fable 5.1
56.4%
Claude Fable 5
54.3%
Claude Opus 4.8 Max
51.4%
GPT-5.5
42.3%
GPT-5.6 Sol
39.4%

EEBench V1,13 道模拟加数字题,SPICE 仿真判分;atopile 团队自付跑分费用,不卖分数。GPT-6 Astra 尚无成绩。

这榜有边界:V1 只评到仿真这一层,不评 PCB 布局、制造和整机点亮,后续想加。13 道题也不多,更难的一道模拟题是围绕运放合成多反馈低通滤波器:解 RC 比例定极点,所有元件推到最坏容差角,增益、截止频率、Q 值还得在限内。

xAI 把 EEBench 写进了 Grok 4.6 的模型卡「工程加速」一节,跟 3D 建模、参数化 CAD 并列,自测 60.0%(xhigh 推理强度),并称在 CAD 这类环境里做了 RL 训练。马斯克说 Grok 4.7 数周内发布,拿 SpaceX 数据加训工程能力,时间可能变。评测方自己掏钱跑分、厂商主动往模型卡里写,这块画布开始有人认了。

4顶嘴

一次失败的运行里有信息,「原理图看着合理」里没有

同一套判卷器倒过来用,就是 RL 的奖励信号。

格雷厄姆在《黑客与画家》里讲,画家看得见画布,边画边改;黑客的反馈来自把程序跑起来。反馈回路要顶用,得即时,还得诚实。一次失败的运行里装的东西不少:哪条电压超限、哪个工作角失败、有没有用不必要的贵方案。团队说这比「模型自己说原理图看着合理」多得多,他们正跟前沿实验室合作,提供更大的评测套件和仿真训练环境。

旧办法

模型出一张原理图,人看一眼,觉得合理就过。模型说得越像越容易过。

新办法

构建、仿真、逐条量电压和元件行为,失败的那一步带着数字回来。说得再像也过不了 3 V 那条线。

2024 年我给 SaaS 登录页接过一个免费的第三方防刷脚本,阿坤在微信上抱怨后台一开他笔记本风扇就起飞。我起先不信,开着任务管理器把页面晾了一小时,GPU 占用每三十来秒跳一下,是脚本在反复跑 canvas 指纹。代码我读过,没觉得哪不对;风扇不看代码,只看功耗。物理层就是这么个裁判,不听你解释。

HN 上的争论也在这条线上。krupan 问:我们从没对人类工程师做过这种规模的测量和反馈回路,为什么?dubbie99 说 AI 整理元件库、核封装、管 BOM 很好用,原理图和布板还是自己画,它犯太多蠢错,但让它复查能抓到人漏掉的。CyLith 让 Claude Opus 4.8 设计一块只用 74 系列逻辑和 GAL、把 EEPROM 图像输出到 VGA 的板子,自己布线,JLC 打样 6 美元,回来有一处错没抓到,飞一根线就能用。cmiles8 说聊选型有帮助,真让它设计板子每次都惨败。amelius 盯着下一个痛点:从 Digikey、LCSC 选料找替代,前提是模型真能读数据手册。合起来看,模型现在像个刚进厂的应届生,跟着老师傅复查、跑腿查料没问题,独立出图还得有人兜底。

5带走

这对你意味着什么:先给它一块会顶嘴的画布,再谈它会不会

团队的结论很克制。

大意是:对一批有用、还在增多的电路问题,答案已经是「能」;但我们还不会让它设计心脏起搏器然后闭着眼装上。AI 会不会电子学,这问题眼下没多少讨论价值,它嘴上什么都会。值得问的是你手头有没有不听解释的裁判:测试、仿真、真机、用户,随便哪个,认结果不认说法。

⚡

为什么值得看:EEBench 把「构建成功」和「电路能用」拆成两个数分开算。前一个数模型几乎都拿得到,后一个数眼下最好的也只有 61.6%。

标称 22 微法,加上电压只剩 11.4 微法。模型说得再像,也得加上电压再算分。

取材声明:本文思想框架取材自保罗·格雷厄姆《黑客与画家》(画家看得见画布、边画边改,黑客靠运行程序获得反馈);事件与数字出自 atopile 团队 2026 年 9 月 4 日 EEBench 博客《Can AI design circuit boards yet?》、xAI Grok 4.6 模型卡及 Hacker News 公开讨论,英文引述为中文大意,细节以原始博客为准。本文为技术科普解读。

テクノロジー

标称 22 微法,加上电压只剩 11.4 微法:AI 画的电路代码编译全过,接上仿真 0.85 毫秒就掉电

2026年9月6日 · 保罗·格雷厄姆《黑客与画家》約 6 分

ngspice 的波形图上,5 V 电源在零点掉下去,受保护的那条母线跟着往下滑,0.85 毫秒后跌破 3 V。题目要它撑 20 毫秒。这份电路是模型写的,源码构建成功,没报一个错。

30 秒读懂
1量法

不让模型点鼠标,让电路先变成一份能跑的代码

起因是前一天 OpenAI 发了 GPT-6 Astra,首页演示它在 KiCad 里操作电路板。

atopile 团队的问题很朴素:AI 做出来的电路到底好不好,拿什么量?他们没让模型去图形 CAD 里点鼠标。你别看那演示热闹,模型的上下文大半耗在坐标、菜单、界面状态上。他们把电路写成声明式代码(atopile 自家的语言),模型直接改元件、连接和电气约束,然后构建、仿真、看哪一步倒下。

判卷全程是确定性的:构建设计,生成电路图和 BOM,跑一组 SPICE 仿真和设计检查。每条要求对应一个带上下限的测量值。技术分之上再叠成本效率,对照参考 BOM 算账,团队原话大意是,电路先能用,成本才算分。元件用真实厂商型号,规格从数据手册抽进 SPICE 模型,还要求真能买到、价格合理。

打个比方

给编程代理配一个编译器和一套测试,EEBench 干的是同一件事,只是测试量的东西换了:从「返回值等不等于 42」换成「母线电压什么时候跌破 3 V」。编译器管语法,仿真器管物理,两道关一道都跳不过去。

2掉电

标称 22 微法,加上 4.7 V 只剩 11.4 微法,题目要的是 545 微法

公开题之一是住宅电表,考的就是断电那一瞬。

题目这么设:5 V 供电消失后,电路得让处理器再活 20 毫秒去保存读数,受保护的母线不能低于处理器 3.0 V 的欠压阈值。多数模型的直觉是对的:加电容。说白了这是本科电路课的题。

做出来是另一回事。真实陶瓷电容一加上直流电压,有效电容会掉得远低于标称,还得算容差。一份提交用的是标称 22 µF,判卷器在 4.7 V 偏压下只量到 11.4 µF 有效电容,需求是 545 µF,差了将近五十倍。源码构建成功,电路照样不干活,ngspice 的输出显示母线 0.85 毫秒后就跌破 3 V。一味加大电容也不行:更贵、更占板子,复电后母线恢复更慢。

2007 年我入行第一个活是政务大厅的排队叫号系统,代码在屏幕上一点毛病没有,验收那天喇叭把「请 A052 号到 3 号窗口」念成一串连读,全厅哄笑。判卷的从来是喇叭里那一声。电容这道题里,喇叭换成了 ngspice。

核心

22 µF 是数据手册封面上的数,11.4 µF 是加上 4.7 V 之后剩下的数。模型知道前者,判卷器只认后者。「编译通过」和「电路能用」中间隔着的,就是这两个数的差。

定格 22 µF、バイアス下では 11.4 µF:コードはビルド成功、レールは 0.85 ms で落ちたコンデンサの帳簿 · 20 ms ホールドアップ対数目盛 · 1–1000 µF20 ms ホールドアップに必要545 µF選んだ部品の定格22 µF4.7 V バイアス時の実効値11.4 µF1101001000 µFレールは 0.85 ms で 3.0 V を割る9 月 1 日ランキング · 13 問Claude Opus 561.6%Grok 4.657.1%Claude Fable 5.156.4%Claude Fable 554.3%Claude Opus 4.8 Max51.4%GPT-5.542.3%GPT-5.6 Sol39.4%0%100%採点は決定論的 ngspice シミュレーション、V1 は基板レイアウトと製造を対象外。
出典:EEBench ブログ、atopile チーム、2026 年 9 月 4 日。コードがビルドできても回路が動くとは限らない:選ばれた 22 µF の部品はバイアス下で 11.4 µF しか残らず、20 ms のホールドアップに必要な 545 µF に遠く及ばず、レールは 0.85 ms で 3.0 V を割った。数値は元の記事に準じる。
3榜单

9 月 1 日榜单:最好的模型六成出头,GPT-6 Astra 还没成绩

团队自己说,几个月前没想到模型能做到这么好。

Claude Opus 5
61.6%
Grok 4.6
57.1%
Claude Fable 5.1
56.4%
Claude Fable 5
54.3%
Claude Opus 4.8 Max
51.4%
GPT-5.5
42.3%
GPT-5.6 Sol
39.4%

EEBench V1,13 道模拟加数字题,SPICE 仿真判分;atopile 团队自付跑分费用,不卖分数。GPT-6 Astra 尚无成绩。

这榜有边界:V1 只评到仿真这一层,不评 PCB 布局、制造和整机点亮,后续想加。13 道题也不多,更难的一道模拟题是围绕运放合成多反馈低通滤波器:解 RC 比例定极点,所有元件推到最坏容差角,增益、截止频率、Q 值还得在限内。

xAI 把 EEBench 写进了 Grok 4.6 的模型卡「工程加速」一节,跟 3D 建模、参数化 CAD 并列,自测 60.0%(xhigh 推理强度),并称在 CAD 这类环境里做了 RL 训练。马斯克说 Grok 4.7 数周内发布,拿 SpaceX 数据加训工程能力,时间可能变。评测方自己掏钱跑分、厂商主动往模型卡里写,这块画布开始有人认了。

4顶嘴

一次失败的运行里有信息,「原理图看着合理」里没有

同一套判卷器倒过来用,就是 RL 的奖励信号。

格雷厄姆在《黑客与画家》里讲,画家看得见画布,边画边改;黑客的反馈来自把程序跑起来。反馈回路要顶用,得即时,还得诚实。一次失败的运行里装的东西不少:哪条电压超限、哪个工作角失败、有没有用不必要的贵方案。团队说这比「模型自己说原理图看着合理」多得多,他们正跟前沿实验室合作,提供更大的评测套件和仿真训练环境。

旧办法

模型出一张原理图,人看一眼,觉得合理就过。模型说得越像越容易过。

新办法

构建、仿真、逐条量电压和元件行为,失败的那一步带着数字回来。说得再像也过不了 3 V 那条线。

2024 年我给 SaaS 登录页接过一个免费的第三方防刷脚本,阿坤在微信上抱怨后台一开他笔记本风扇就起飞。我起先不信,开着任务管理器把页面晾了一小时,GPU 占用每三十来秒跳一下,是脚本在反复跑 canvas 指纹。代码我读过,没觉得哪不对;风扇不看代码,只看功耗。物理层就是这么个裁判,不听你解释。

HN 上的争论也在这条线上。krupan 问:我们从没对人类工程师做过这种规模的测量和反馈回路,为什么?dubbie99 说 AI 整理元件库、核封装、管 BOM 很好用,原理图和布板还是自己画,它犯太多蠢错,但让它复查能抓到人漏掉的。CyLith 让 Claude Opus 4.8 设计一块只用 74 系列逻辑和 GAL、把 EEPROM 图像输出到 VGA 的板子,自己布线,JLC 打样 6 美元,回来有一处错没抓到,飞一根线就能用。cmiles8 说聊选型有帮助,真让它设计板子每次都惨败。amelius 盯着下一个痛点:从 Digikey、LCSC 选料找替代,前提是模型真能读数据手册。合起来看,模型现在像个刚进厂的应届生,跟着老师傅复查、跑腿查料没问题,独立出图还得有人兜底。

5带走

这对你意味着什么:先给它一块会顶嘴的画布,再谈它会不会

团队的结论很克制。

大意是:对一批有用、还在增多的电路问题,答案已经是「能」;但我们还不会让它设计心脏起搏器然后闭着眼装上。AI 会不会电子学,这问题眼下没多少讨论价值,它嘴上什么都会。值得问的是你手头有没有不听解释的裁判:测试、仿真、真机、用户,随便哪个,认结果不认说法。

⚡

为什么值得看:EEBench 把「构建成功」和「电路能用」拆成两个数分开算。前一个数模型几乎都拿得到,后一个数眼下最好的也只有 61.6%。

标称 22 微法,加上电压只剩 11.4 微法。模型说得再像,也得加上电压再算分。

取材声明:本文思想框架取材自保罗·格雷厄姆《黑客与画家》(画家看得见画布、边画边改,黑客靠运行程序获得反馈);事件与数字出自 atopile 团队 2026 年 9 月 4 日 EEBench 博客《Can AI design circuit boards yet?》、xAI Grok 4.6 模型卡及 Hacker News 公开讨论,英文引述为中文大意,细节以原始博客为准。本文为技术科普解读。