9 月 3 日,GPT-6 Astra 发布。

这几天我一直在到处给它找活干,前后凑了五个作品。前三个是我从社区里找来的案例,后两个是我自己出的题,亲手跑了一遍。

我给它的东西都很简单,一句话、一张 iPhone 截图、一张住宅平面图。

每段录屏最长不过一分钟,但录屏背后,其实都是十几分钟连续工作的结果。

而这十几分钟里,我一次键盘都没碰。

基准分数我放到后面。先看它到底做出了什么。

一、一个可以上手玩的海洋

我找来的第一个案例,是一个实时渲染的海洋网页。

点开之后,眼前就是一整片海。不是提前做好的视频,也不是循环播放的动画,是 WebGL 2 实时渲染,你看到的每一帧,都是当场算出来的。

右边有一整块环境控制面板。

天气有五档,Calm、Ocean、Storm、Sunset、Night,点哪个,整个环境就跟着变。

时间轴可以从正午一路拖到半夜;风力和浪高各有一条滑杆,拉到 94% 左右,浪尖开始翻出明显的白沫。

画质档位直接开到了 Ultra。

录屏里,我看到它从 Calm 切到 Storm,原本细碎的海面很快变成大幅起伏的涌浪,浪尖开始卷起白沫。

再切到 Night,整片海一下暗下来,只剩一束月光落在水面上,随着浪的起伏被拉成一条长长的亮带。

海洋模拟器 Calm 白天模式画面
海洋模拟器日落后的夜色水面

如果把它拆成传统开发任务,这里面其实已经包含了实时渲染、海面材质、光照、环境系统、交互控件和性能适配。

但这次,从一句话到一个能直接上手玩的海洋模拟器,GPT-6 自己跑完了。

二、一镜到底,它先给自己排练了一遍

第二个案例是一条竖屏视频。

真正让我觉得有意思的,不只是下面那条成片,还有上半屏。

画面被分成两部分。

上面是一张 3D 布局图,7 个连续场景、43 个角色,连摄影机要走哪条路线都提前画了出来。

下面才是最后生成的视频。

镜头从宴会厅门口开始,进电梯,穿过服务走廊,最后一路进入厨房。

从头到尾没有切镜。

也就是说,在真正开拍之前,它先给自己做了一次完整的排练。

场景怎么连,人物放在哪里,摄影机从哪儿经过,哪些地方容易穿帮,它先把这些关系规划出来,然后再按照这套规划继续执行。

过去我比较习惯把 AI 生成理解成一次出一个结果。

但这个案例明显不是。

它已经开始先想清楚自己接下来十几步要干什么,再动手去做。

三、一辆车,自己拆成几百个零件

第三个案例是一段 SUV 拆解动画。

一辆完整的车停在转台中央。

SUV 整车立于转台画面

动画开始之后,车顶、外壳、玻璃、内饰、座椅、底盘开始一层一层向外分离。

最后,原本完整的一辆车被彻底拆开。

几百个零件在黑色背景上重新排成矩阵,轮子归轮子,座椅归座椅,同类零件整齐地排到一起。

汽车零件爆炸拆解后排成矩阵画面

我觉得这个案例真正难的地方,其实不是让零件飞出去。

是模型得先知道,这辆车到底由什么组成。

哪些东西属于外壳,哪些属于内饰,哪些应该先拆,哪些应该后拆,零件之间是什么层级关系,最后又该按照什么逻辑重新排列。

传统做法里,这意味着建模、拆件、建立层级、设计动画、逐层调整位置。

中间每一步都需要人。

而这次,我看到的是模型自己理解结构,再自己决定拆解和归位顺序。

四、一张截图,变成一个手机展示站

后面两个,是我自己出的题。

点击查看示例:链接

第一道题,我只给了它一张 iPhone 截图。

我的要求也没写得多复杂,做一个全方位的手机展示网站,机身可以拖动查看,背景和整体视觉帮我一起搭好。

然后我就没再碰它。

十几分钟以后,它交回来一个叫 FORM & FEEL 的网站,副标题是数字产品体验室。

主体是一套 iPhone 17 的 360° 产品展示页。

FORM & FEEL 网站 iPhone 正面展示页

手机不是一张图。

它直接做成了实时渲染的 3D 模型,可以用鼠标拖着转一整圈,正面、侧面、背面随便看。

右边还有一列配色按钮。

从鼠尾草绿切到曜石黑,不只是手机壳换个颜色。机身材质、背景色、地面的倒影和环境光都会一起变化。

iPhone 曜石黑背面 360 度展示

甚至连手机屏幕都不是贴上去的一张图。

点一下,可以解锁。

进去之后还能继续点桌面上的应用。

为了配合产品展示,它还自己搭了一套浅绿色山峦背景,把景深、光照和产品位置一起处理好了。手机后方压着巨大的 iPhone 17 字样,页面底部又做了三个可以展开的交互模块。

页脚甚至主动补了一句,独立概念展示,非官方页面。

我给它的输入,就只有一张截图。

五、一张平面图,长出一栋可以逛的房子

第二道题,我给它的是一张住宅平面图。

项目叫 SOLACE。查看示例链接。

三居室加书房,围合式布局,中间有庭院和泳池。

我没有给 3D 模型,也没有给效果图。

只有一张二维平面图。

SOLACE 住宅平面图原图,案例输入

最后交回来的,是一个可以直接交互的 3D 住宅庭院。

房子、树、泳池、躺椅都按照平面图里的关系搭了出来,建筑围合方式、院子的位置、泳池和主体建筑之间的关系,都能对应回原始图纸。

从平面图生成的 3D 庭院与泳池外景

而且它没有停在把平面图立起来这一步。

整个项目里做了 7 个可以进入的空间。

我可以从庭院和泳池一路逛进去,最后走到厨房里面。

生成的厨房室内漫游画面

右上角还有一整套光照控制。

时间可以拖动。

我把它停在 17:20,整个场景就进入傍晚的暖色状态。

太阳方向和高度可以单独调整,室内灯光也可以独立打开和关闭。

视角则给了三种,环境观察、自由漫游、平面总览。

一张住宅平面图,最后变成了一栋我可以自己走进去逛的房子。

六、真正变的,是我开始不用插手了

把这五个案例放在一起看,我觉得这次最值得讨论的,其实不是某一个 Demo 有多炫。

是我在整个过程里的位置变了。

以前我让 AI 做复杂任务,基本逃不开一件事,不断接管。

它写一段,我检查一下;做错了,我重新提示;卡住了,我帮它换工具;前后对不上,我再把上下文补回去。

所谓 AI 帮我干活,很多时候更像我站在旁边盯着一个速度很快、但随时需要指导的新同事。

这次不太一样。

我给目标,然后它自己往下走。

这种变化,其实也能从数据里看到。

OSWorld 2.0 里,GPT-6 的计算机操作成绩到了 72.6%,上一代大约是 65.7%,平均任务完成时间还缩短了约 47%。

Terminal-Bench 4.0 做到了 57.9%。

再往更难的任务看,ARC-AGI-3 在适配 harness 下接近饱和,做到 99.9%;FrontierMath Tier 4 到了 97.6% 到 98%;ExploitBench 是 100%。

单看任何一个数字,我其实都不会觉得特别震撼。

真正让我在意的是,这些能力开始同时出现了。

它不只是更会推理,也不只是更会写代码。

它开始能自己规划、操作电脑、调用工具、跑代码、检查结果、发现问题,再继续往下修。

过去散落在不同模型、不同工具里的能力,第一次开始在一个任务里连起来。

这也是为什么前面五个作品看起来完全不同,海洋模拟、视频制作、汽车拆解、3D 产品站、建筑可视化,但我实际使用它们的方式却几乎一样,

告诉它我要什么。

然后等它做完。

GPT-6 的上下文窗口已经拉到 105 万 token,训练规模也是 OpenAI 历史上最大的一次。

但我觉得真正改变使用体验的,并不是它一次能记多少东西。

是它终于有能力在一个任务里面持续工作足够久。

不用每做一步就停下来问我,接下来呢,要继续吗,这样可以吗。

OpenAI 在提示词指南里其实已经把这种变化说得很明确,不要再把它只当成一个等着聊天的模型,把请求当成真正的行动指令,让它从目标里理解意图,持续执行,直到拿出一个可以检查的结果。

我这几天实际用下来,最明显的感受也是这个。

以前写 Prompt,我经常在想,我要怎么一步一步教 AI 做?

现在我开始想的是,最后我要验收什么?

这是两个完全不同的问题。

前者要求我先懂整个生产过程。

后者只要求我知道自己想要什么,以及什么样的结果算完成。

这也是我觉得 GPT-6 真正开始降低门槛的地方。

门槛降低,并不是以前要写十行代码、现在只要写一行。

是过去需要建模软件、前端工具、视频工具、渲染引擎,以及好几个专业角色接力完成的事情,现在开始可以从一句自然语言直接启动。

中间那一大段原本需要人亲自操作的过程,正在一点一点消失。

当然,我依然要判断结果好不好,也依然要决定它应该做什么。

但我不再需要一直站在旁边替它踩油门、打方向、换挡。

这几天我最强烈的感受,一句话概括,

GPT-6 干活的十几分钟,我一次手都没插上。

以前我觉得 AI 最重要的变化,是它越来越聪明。

现在我开始觉得,真正重要的可能是另一件事,

它终于开始能自己把事情做完了。