Tech
AI 模型的发布速度,已经超过了人类的评测能力
2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》~1 min read
一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。
30 秒读懂
7 月内,Claude Fable 5、Sonnet 5(输入价 $2/M token)、Grok 4.5、Kimi K2.7 Code 相继发布——没有任何一次评测能在下一个模型出来之前跑完。
Kimi K2.7 Code 成为第一个进入 GitHub Copilot 模型选择器的开源权重模型,开源正式挤进日常工具链。
库兹韦尔的加速回报定律:范式迁移速率每 10 年翻一番。这不是未来预测,是正在你工具栏里发生的事。
当前不是一条 S 曲线变陡——是多条 S 曲线同时接力,评测方法论本身成了最快过期的东西。
应对策略不是「跟上更新」,是重新校准感知框架:你在追一场接力赛,不是某一棒。
1 发布节奏
评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事
正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。
Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。
正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。
核心 GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次 。这不是 thread 过期,是评测速度本身成了瓶颈。
2 加速回报定律
库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气
《奇点临近》第二章里有一个论点,大多数人记错了它的意思。
库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。
他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。
打个比方
你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。
3 S 曲线级联
这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层
每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。
库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。
对比为估算,说明发布密度与评测能力之间的结构性错位。
PARADIGM SHIFTS ARRIVE FASTER EACH DECADE
2010s
2020s
2024–25
NOW
Deep Learning
~5 yr plateau
Transformer / LLM
~2 yr plateau
GPT-5 / Gemini 2.5
weeks, not years
curves now
overlap
paradigm S-curve
overlap zone
Source: Ray Kurzweil, The Singularity Is Near ; 2026 model release cadence. Each new paradigm has a shorter plateau before the next one begins. Evaluation pipelines are measured in months; release cycles are now measured in weeks.
有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。
4 这对你意味着什么
该变的不是追模型的速度,而是你感知技术进度的那个框架
每棒都有终点,接力赛没有。
不是建议你放弃跟进新模型。而是说:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它告诉你工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,不只是价格信号,是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。
框架 核心逻辑
旧框架 评测完一个,迁移,再等下一轮评测
当前现实 评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架 追接力的形状;押迁移成本低的工具层,而不是押某一棒
你真正能带走的东西,不是某次评测的结论,而是看这件事的框架。加速回报定律让库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,不是因为他知道哪个具体模型会赢,而是因为他看的是那条接力的形状,而不是其中某一棒跑得多快。
模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。
框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。
技术
AI 模型的发布速度,已经超过了人类的评测能力
2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》约 5 分钟
一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。
30 秒读懂
7 月内,Claude Fable 5、Sonnet 5(输入价 $2/M token)、Grok 4.5、Kimi K2.7 Code 相继发布——没有任何一次评测能在下一个模型出来之前跑完。
Kimi K2.7 Code 成为第一个进入 GitHub Copilot 模型选择器的开源权重模型,开源正式挤进日常工具链。
库兹韦尔的加速回报定律:范式迁移速率每 10 年翻一番。这不是未来预测,是正在你工具栏里发生的事。
当前不是一条 S 曲线变陡——是多条 S 曲线同时接力,评测方法论本身成了最快过期的东西。
应对策略不是「跟上更新」,是重新校准感知框架:你在追一场接力赛,不是某一棒。
1 发布节奏
评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事
正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。
Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。
正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。
核心 GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次 。这不是 thread 过期,是评测速度本身成了瓶颈。
2 加速回报定律
库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气
《奇点临近》第二章里有一个论点,大多数人记错了它的意思。
库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。
他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。
打个比方
你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。
3 S 曲线级联
这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层
每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。
库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。
对比为估算,说明发布密度与评测能力之间的结构性错位。
范式转换每十年提速一倍——评测速度跟不上
2010 年代
2020 年代
2024–25
现在
深度学习
约 5 年平台期
Transformer / LLM
约 2 年平台期
GPT-5 / Gemini 2.5
以周计,不再以年
曲线已开始
互相叠加
范式 S 曲线
叠加区间
来源:雷·库兹韦尔《奇点临近》;2026 年模型发布节奏。每一个新范式的平台期比上一个更短,下一个已经在路上。评测流程以月计,发布周期以周计。
有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。
4 这对你意味着什么
该变的不是追模型的速度,而是你感知技术进度的那个框架
每棒都有终点,接力赛没有。
跟进新模型没什么问题。问题在于:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它说明工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,是一个价格信号,背后是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。
框架 核心逻辑
旧框架 评测完一个,迁移,再等下一轮评测
当前现实 评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架 追接力的形状;押迁移成本低的工具层,而不是押某一棒
你真正能带走的东西,是看这件事的框架,而不是某次评测的结论。库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,靠的是盯住那条接力的形状,而不是某一棒跑得多快。
模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。
框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。
テクノロジー
AI 模型的发布速度,已经超过了人类的评测能力
2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》約 5 分
一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。
30 秒读懂
7 月内,Claude Fable 5、Sonnet 5(输入价 $2/M token)、Grok 4.5、Kimi K2.7 Code 相继发布——没有任何一次评测能在下一个模型出来之前跑完。
Kimi K2.7 Code 成为第一个进入 GitHub Copilot 模型选择器的开源权重模型,开源正式挤进日常工具链。
库兹韦尔的加速回报定律:范式迁移速率每 10 年翻一番。这不是未来预测,是正在你工具栏里发生的事。
当前不是一条 S 曲线变陡——是多条 S 曲线同时接力,评测方法论本身成了最快过期的东西。
应对策略不是「跟上更新」,是重新校准感知框架:你在追一场接力赛,不是某一棒。
1 发布节奏
评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事
正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。
Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。
正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。
核心 GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次 。这不是 thread 过期,是评测速度本身成了瓶颈。
2 加速回报定律
库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气
《奇点临近》第二章里有一个论点,大多数人记错了它的意思。
库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。
他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。
打个比方
你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。
3 S 曲线级联
这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层
每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。
库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。
对比为估算,说明发布密度与评测能力之间的结构性错位。
パラダイム転換は10年ごとに倍速に——評価速度が追いつかない
2010年代
2020年代
2024–25
現在
深層学習
約5年の定常期
Transformer / LLM
約2年の定常期
GPT-5 / Gemini 2.5
週単位、もはや年単位ではない
曲線が
重なり始めた
パラダイムS字曲線
重複ゾーン
出典:レイ・カーツワイル『シンギュラリティは近い』;2026年のモデルリリースペース。各新パラダイムの定常期は前より短く、次が始まる前に終わる。評価パイプラインは月単位、リリースサイクルは週単位になった。
有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。
4 这对你意味着什么
该变的不是追模型的速度,而是你感知技术进度的那个框架
每棒都有终点,接力赛没有。
不是建议你放弃跟进新模型。而是说:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它告诉你工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,不只是价格信号,是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。
框架 核心逻辑
旧框架 评测完一个,迁移,再等下一轮评测
当前现实 评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架 追接力的形状;押迁移成本低的工具层,而不是押某一棒
你真正能带走的东西,不是某次评测的结论,而是看这件事的框架。加速回报定律让库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,不是因为他知道哪个具体模型会赢,而是因为他看的是那条接力的形状,而不是其中某一棒跑得多快。
模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。
框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。