vlog
← 返回全部文章

Tech

AI 模型的发布速度,已经超过了人类的评测能力

2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》~1 min read

一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。

30 秒读懂
1发布节奏

评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事

正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。

Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。

正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。

核心

GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次。这不是 thread 过期,是评测速度本身成了瓶颈。

2加速回报定律

库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气

《奇点临近》第二章里有一个论点,大多数人记错了它的意思。

库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。

他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。

打个比方

你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。

3S 曲线级联

这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层

每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。

库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。

发布密度(2024 年同期)
约 1–2 款/月
发布密度(2026 年 7 月)
4 款主力/月
典型评测周期
4–6 周

对比为估算,说明发布密度与评测能力之间的结构性错位。

PARADIGM SHIFTS ARRIVE FASTER EACH DECADE 2010s 2020s 2024–25 NOW Deep Learning ~5 yr plateau Transformer / LLM ~2 yr plateau GPT-5 / Gemini 2.5 weeks, not years curves now overlap paradigm S-curve overlap zone
Source: Ray Kurzweil, The Singularity Is Near; 2026 model release cadence. Each new paradigm has a shorter plateau before the next one begins. Evaluation pipelines are measured in months; release cycles are now measured in weeks.

有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。

4这对你意味着什么

该变的不是追模型的速度,而是你感知技术进度的那个框架

每棒都有终点,接力赛没有。

不是建议你放弃跟进新模型。而是说:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它告诉你工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,不只是价格信号,是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。

框架核心逻辑
旧框架评测完一个,迁移,再等下一轮评测
当前现实评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架追接力的形状;押迁移成本低的工具层,而不是押某一棒

你真正能带走的东西,不是某次评测的结论,而是看这件事的框架。加速回报定律让库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,不是因为他知道哪个具体模型会赢,而是因为他看的是那条接力的形状,而不是其中某一棒跑得多快。

模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。

框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。

技术

AI 模型的发布速度,已经超过了人类的评测能力

2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》约 5 分钟

一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。

30 秒读懂
1发布节奏

评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事

正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。

Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。

正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。

核心

GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次。这不是 thread 过期,是评测速度本身成了瓶颈。

2加速回报定律

库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气

《奇点临近》第二章里有一个论点,大多数人记错了它的意思。

库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。

他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。

打个比方

你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。

3S 曲线级联

这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层

每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。

库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。

发布密度(2024 年同期)
约 1–2 款/月
发布密度(2026 年 7 月)
4 款主力/月
典型评测周期
4–6 周

对比为估算,说明发布密度与评测能力之间的结构性错位。

范式转换每十年提速一倍——评测速度跟不上 2010 年代 2020 年代 2024–25 现在 深度学习 约 5 年平台期 Transformer / LLM 约 2 年平台期 GPT-5 / Gemini 2.5 以周计,不再以年 曲线已开始 互相叠加 范式 S 曲线 叠加区间
来源:雷·库兹韦尔《奇点临近》;2026 年模型发布节奏。每一个新范式的平台期比上一个更短,下一个已经在路上。评测流程以月计,发布周期以周计。

有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。

4这对你意味着什么

该变的不是追模型的速度,而是你感知技术进度的那个框架

每棒都有终点,接力赛没有。

跟进新模型没什么问题。问题在于:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它说明工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,是一个价格信号,背后是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。

框架核心逻辑
旧框架评测完一个,迁移,再等下一轮评测
当前现实评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架追接力的形状;押迁移成本低的工具层,而不是押某一棒

你真正能带走的东西,是看这件事的框架,而不是某次评测的结论。库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,靠的是盯住那条接力的形状,而不是某一棒跑得多快。

模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。

框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。

テクノロジー

AI 模型的发布速度,已经超过了人类的评测能力

2026 年 7 月 13 日 · 雷·库兹韦尔《奇点临近》約 5 分

一个月,四款主力模型。Claude Fable 5、Claude Sonnet 5、Grok 4.5、Kimi K2.7 Code——不是在某个季度里,是在 2026 年 7 月这一个日历月内接连上线。GitHub Discussions #187143 问的是「2026 年必装 AI 工具」,这个问题在一个月内过了两遍期。不是因为有人删帖,是因为答案变了。当评测还没写完,下一个模型已经在工具栏里了——这事要紧,不是因为它让人焦虑,而是因为它告诉你:你平时用来感知技术进度的那把尺,这把尺本身正在缩水。

30 秒读懂
1发布节奏

评测周期比发布周期长了,这不是玩笑,是今年 7 月真实发生的事

正常的「看到公告→读报告→写工作流→开始用」这条路,在本月中途就断了。

Claude Fable 5 是 Anthropic 的第一个 Mythos 级正式模型,在 7 月上线时就已经不是「最新」——因为同月 Claude Sonnet 5 跟上来,能力接近旧旗舰 Opus 4.8,输入价格压到 $2/M token,促销期到 8 月 31 日。你还没决定要不要从原来的模型迁移,成本-能力曲线已经重新划过一次。Grok 4.5 同期发布,重点是编程和 Agent 任务能力强化。月内最惊人的一件事,是 Moonshot AI 的 Kimi K2.7 Code 进入了 GitHub Copilot 的模型选择器,成为第一个开进去的开源权重模型——这意味着在开发者最高频的工具界面里,开源和闭源已经并排放在同一个下拉菜单里了。

正常的评测流程是什么?你要搭 benchmark 测试集,要跑代码生成任务,要在真实项目里做 A/B 对比,要等社区积累有效样本量,要写报告,要让团队读报告,要做决策。这至少要四到六周。这不是评测团队不够快,是发布节奏系统性地超过了任何人类机构能跑完评测周期的速度。

核心

GitHub Discussions #187143 的「2026 年必装 AI 工具」答案在一个月内失效了两次。这不是 thread 过期,是评测速度本身成了瓶颈。

2加速回报定律

库兹韦尔说这件事会发生,他的时间表比多数人预想的早了整整一个节气

《奇点临近》第二章里有一个论点,大多数人记错了它的意思。

库兹韦尔说的不是「未来有一天,技术会突然变快」。他说的是:用上一轮产出的工具去造下一轮的工具,这个正反馈意味着进步速率本身是指数的——他把这叫双重指数(double exponential)。每 10 年,范式迁移的速率翻一番。不是单次进步翻番,是「进步多快」这件事本身在翻番。

他还说了另一件事,经常被误读成悲观论:当前的 S 曲线趋平,不代表趋势结束,代表下一棒接力者正在某处加速。摩尔定律只是整条加速曲线上的其中一棒。AI 模型能力提升,是新的一棒。而这一棒的特点是:它用 AI 工具来辅助改进 AI 模型,正反馈比历史上任何一棒都要紧密。库兹韦尔的这个框架写于 2005 年,当时他预测范式迁移会在 2020 年代开始让人感到明显的「时间压缩」。时间压缩正在发生。压的就是评测周期。

打个比方

你在用卷尺量一列火车。问题不是你量得慢,是火车正在加速——等你量完车头到车尾,车尾已经不在原来的位置了。AI 评测就是这把卷尺,发布节奏就是这列正在加速的火车。卷尺本身没坏,只是它量不了一个还在动的东西。

3S 曲线级联

这不是「AI 变快了」——是多条 S 曲线同时交棒,评测方法论本身是过期最快的那一层

每一条 S 曲线趋平的时候,下一条接班的那条早已在某个角落里跑着了。

库兹韦尔书里有一个特别精确的历史观:算力的指数提升不是一条直线,是多条 S 曲线首尾相接——每条都爬升、趋平、交棒。继电器交给真空管,真空管交给晶体管,晶体管交给集成电路。每一次交棒,都在上一棒趋平之前就已经开始加速。当前 AI 模型发布节奏里看到的,正是这套机制在软件侧的级联。Fable 5 不是 Sonnet 5 的竞争者,Sonnet 5 不是 Kimi K2.7 的竞争者——它们更像是几条不同 S 曲线同时处于上升段,凑在一起,把你的工具栏挤得满满当当。

发布密度(2024 年同期)
约 1–2 款/月
发布密度(2026 年 7 月)
4 款主力/月
典型评测周期
4–6 周

对比为估算,说明发布密度与评测能力之间的结构性错位。

パラダイム転換は10年ごとに倍速に——評価速度が追いつかない 2010年代 2020年代 2024–25 現在 深層学習 約5年の定常期 Transformer / LLM 約2年の定常期 GPT-5 / Gemini 2.5 週単位、もはや年単位ではない 曲線が 重なり始めた パラダイムS字曲線 重複ゾーン
出典:レイ・カーツワイル『シンギュラリティは近い』;2026年のモデルリリースペース。各新パラダイムの定常期は前より短く、次が始まる前に終わる。評価パイプラインは月単位、リリースサイクルは週単位になった。

有人会说「别急,社区自然会筛选出好模型」。这是对的,但筛选过程本身也在加速。以前等半年社区会给出稳定共识,现在共识形成到被新一轮发布推翻,可能只有三周。

4这对你意味着什么

该变的不是追模型的速度,而是你感知技术进度的那个框架

每棒都有终点,接力赛没有。

不是建议你放弃跟进新模型。而是说:如果你把「评测完最新的,再迁移到下一个」当成正常工作流,这个工作流已经系统性地失效了。Kimi K2.7 进 Copilot 这件事值得认真对待,不是因为它打败了哪个闭源模型,而是因为它告诉你工具链的门槛已经改变。Sonnet 5 的 $2/M token 输入价,不只是价格信号,是「能力等级 X 的准入门槛又往下移了」——过去只有旗舰价位才能用到的能力,现在是中低价位。

框架核心逻辑
旧框架评测完一个,迁移,再等下一轮评测
当前现实评测周期比发布周期长;单次评测结论是最快过期的东西
有效框架追接力的形状;押迁移成本低的工具层,而不是押某一棒

你真正能带走的东西,不是某次评测的结论,而是看这件事的框架。加速回报定律让库兹韦尔在 2005 年就预测到了 2020 年代的时间压缩,不是因为他知道哪个具体模型会赢,而是因为他看的是那条接力的形状,而不是其中某一棒跑得多快。

模型每个月过期,框架不会。停止问「哪个最好」,开始问「这棒交出去了没有」。

框架取材:《奇点临近》雷·库兹韦尔(加速回报定律、双重指数、S 曲线级联、范式迁移速率每 10 年翻番)。事件依据:Claude Fable 5(Anthropic 第一个 Mythos 级正式模型,2026 年 7 月上线)、Claude Sonnet 5(输入价 $2/M token,8 月 31 日前促销)、Grok 4.5(xAI,强化编程与 Agent 任务)、Kimi K2.7 Code(Moonshot AI,第一个进入 GitHub Copilot 模型选择器的开源权重模型);GitHub Discussions #187143 所讨论的「2026 年必装 AI 工具」答案一月内失效两次。本文为科普解读,非专业技术评测建议。