一句提示、约十分钟:乐高金门大桥是怎么搭出来的?
二月时他试过同一个任务:让 Codex 构建 LEGO 模型,需要自定义 skill、复杂指令和数小时迭代,结果仍不理想。九月,作者要求构建 Golden Gate Bridge,做法只剩一句话——「Use Studio to build the golden gate bridge in lego」,同时给 Astra 开了 BrickLink Studio的权限。大约十分钟后,第一版就出来了,路面上还包含几辆小车。
速度来自两种操作方式的拼接:Astra 先弄清 Studio 内置零件库里有哪些零件,用 Python 把模型组装出来,再回到 Studio 里打开检查、继续改。代码负责批量生成,图形界面负责看效果,来回切换。
需要卡住的地方也很清楚:这是一个人的一次体验。十分钟从哪一步开始计时、中间有没有人工干预、失败过几次,这些都没有交代;二月那次「数小时还不理想」也没有具体小时数与成功标准。两个数字不能直接相减。
从一句话提示到乐高金门大桥的五个动作
- 1把任务写成人话
二月同类任务用 Codex 要自定义 skill、复杂指令和数小时迭代,结果仍不理想;这次的提示只有一行:Use Studio to build the golden gate bridge in lego,没有尺寸,也没有零件清单。
- 2接入 BrickLink Studio
模型可以直接操作作者平时做乐高模型会用的那个应用。
- 3读 Studio 内置零件库
先确认库里有哪些可用零件,再决定怎么搭。
- 4用 Python 拼模型
把设计落到脚本里生成模型,而不是在界面上一点点手点。
- 5在 Studio 打开检查
在图形界面里查看成品并继续修改,代码与应用来回切换。
同一座乐高金门大桥,从数小时到约十分钟
二月,作者让 Codex 构建乐高模型,需要自定义 skill、复杂指令和数小时迭代,结果仍不理想,他当时判断模型不擅长这件事。
- 旧模型尝试
二月用 Codex 构建乐高模型需要自定义 skill、复杂指令和数小时迭代,结果仍不理想。
took a custom skill, complicated instructions, and hours of iteration. And it was still not great.
- Astra 生成第一版
给 Astra 访问 BrickLink Studio,提示用 Studio 构建乐高金门大桥;约十分钟后得到第一版,包含路面小车。
About ten minutes later, I had a first version, complete with little cars on the road.
- 跨代码与应用迭代
Astra 识别 Studio 内置零件库,用 Python 组装,再在 Studio 打开检查迭代。
Astra figured out what parts were available in Studio's bundled library, used Python to assemble the model, then opened it in Studio to inspect and iterate on it.
- 扩展成展示网站
后来做展示乐高模型的网站,要求 3D 浏览与下载构建文件;Astra 额外添加上传界面,并用 Sign in with ChatGPT 门控为仅管理员可用。
I wanted people to browse them in 3D and download the build files. Astra also added an interface for uploading more models.
结果:完成第一版桥梁,并扩展为可 3D 浏览、下载与上传的乐高模型展示网站。
不能据此证明:不能证明 Astra 普遍能在这个时间完成类似任务,也不能证明零件选择、结构强度、网站质量或权限安全。
基于证据重建事件顺序,非逐字对话
一句提示加一个应用权限,能不能搭出乐高金门大桥
GPT-6 Astra 能否仅凭一句提示和 BrickLink Studio 访问权限构建乐高金门大桥?
- 实验设置
- 给 Astra 访问 BrickLink Studio,提示为 Use Studio to build the golden gate bridge in lego;它先识别 Studio 内置零件库,用 Python 组装模型,再在 Studio 打开检查并迭代。
- 样本与轮次
- 1 个提示/任务;迭代轮数未知;约十分钟得到第一版,计时方式未知。
- 模型
- GPT-6 Astra、Codex
- 判定指标
- 是否生成第一版乐高金门大桥、是否包含路面小车、从提示到第一版约十分钟。
- 对照或基线
- 与二月用 Codex 需自定义 skill、复杂指令、数小时迭代且仍不理想作非严格前后对比;无严格对照。
结果:约十分钟后得到第一版,路面包含小车,之后继续精炼。
边界:单次个人体验,无独立验证;时间口径、模型环境、任务轮数与失败次数均未知;结果质量未量化。
既然关键动作是「把应用交出去」,那到底该给哪些、旧 skill 还留不留?
为什么该把平时用的软件交出去,而不是只发文字?
因为它能在一个应用里做、在另一个应用里查,再把结果拼起来,而这正是它核实自己有没有做完的方式。作者的建议很直接:你会用 BrickLink Studio 做乐高、用 Blender 做 3D、用视频剪辑工具剪视频,就把这些交给它,而不是只发文字描述。作者用到的专业软件包括 BrickLink Studio、Blender、DaVinci Resolve 和 FFmpeg。
反面例子同样具体:团队给旧模型写的视频剪辑 skill,在 Astra 处理发布视频时反而碍事;去掉这些 skill 的「素净」配置效果更好。所以作者让大家先不带 skill 跑一遍,看还需不需要。
这里只有定性描述:任务细节、对比指标、旧 skill 具体卡在哪里,都没有说明。
类比旧 skill 反而拖后腿像给已经会开车的人塞一本手写路书,他一边要照做一边还要看路,反而更慢。
没写进需求文档的交互,它为什么会自己补上?
因为作者发现,它会把「做出这个功能大概是什么体验」一并想掉。两组界面可以说明这件事:作者只快速口述想法和一段参考对话,拿到的浏览器图像编辑器就已经有 ⌘-Z 和其他常见快捷键、图层和隐藏图层;后来要一个产品反馈模式,做出来的界面可以高亮应用局部、把评论钉在对应元素上、设优先级、编辑反馈、标记已解决。
能支持的结论只有:作者给了粗略想法,成品里却出现了他没有详细描述的交互。规格文档、验收标准或缺陷记录都没有公开,所以不能证明这些交互补得完整,也不能证明适合生产环境。
Thumbnail Studio:没说过的交互它自己补
作者想做 Thumbnail Studio 来生产创意素材,并后续要求 Product Feedback mode 与自动化反馈处理。
- 粗略想法输入
作者快速表达想法和参考对话,没有写完整规格。
- 补全编辑器交互
Astra 实现浏览器图像编辑器交互,包括 ⌘-Z、其他快捷键、图层和隐藏图层。
Astra figured out a lot of the detailed interactions you'd expect from an image editor in the browser, including ⌘-Z and other familiar shortcuts, layers, and the ability to hide them.
- 反馈界面
Astra 实现高亮应用部分、钉评论、设优先级、编辑反馈和标记解决,作者未详细描述这些交互。
I could highlight parts of the app, pin comments to them, set priorities, edit feedback, and mark it as resolved. I hadn't described any of those interactions in detail.
结果:作者说能快速下发想要的能力,Astra 会推演体验并实现交互。
不能据此证明:单项目主观体验,不能证明生成的交互完整、无缺陷或适合生产环境。
基于证据重建事件顺序,非逐字对话
从口述想法到图像编辑器与反馈后台
Astra 能否从粗略想法构建 Thumbnail Studio,并实现 Product Feedback mode 与自动化反馈处理?
- 实验设置
- 作者快速表达想法和参考对话;之后要求 Product Feedback mode 以及检查、排序、实现反馈的自动化。
- 样本与轮次
- 样本量或轮数未给出;一个项目。
- 模型
- Astra
- 判定指标
- 是否实现图像编辑器交互以及高亮、钉评论、优先级、编辑、标记解决;无量化验收标准。
- 对照或基线
- 无明确对照。
结果:Astra 实现了快捷键、图层、隐藏图层,以及高亮、钉评论、优先级、编辑和标记解决,而这些交互他未详细描述。
边界:单项目个人体验,无独立验证、可用性测试或缺陷统计。
补交互之外,它还会自己补上没人开口要的工具。
它主动补上的工具:预览、上传后台与素材拼接
作者给 Astra 一张 Appshot、正在写的文章和 Codex 应用代码库,它读了文章、认出文中提到的 3D 演示,重建出一个可以动画的完整 3D 界面,还自己做了个预览工具,用来播放、暂停、重复和换角度看——作者明确说这个工具他没要过。
乐高展示网站同样如此:他要的是 3D 浏览和下载构建文件,Astra 额外加了上传入口,并用 Sign in with ChatGPT 把这个入口锁给他一个人当管理员。更日常的一例是做对比视频时,他让 Astra 去翻旧对话找回早期版本动画、在桌面找一段录屏、再从 X 文章里取最终版本,最后自行合成,不用他逐个指路。
网站是否上线、代码质量如何、权限实现与安全性,以及「自己找文件」有没有漏过东西,都没有交代。
一张 Appshot 换来一套动画和一把没人要的预览尺
作者喜欢 Nick Baumann 在 X 上的动画,给 Astra 一个 Appshot、正在写的文章和 Codex app codebase 访问权限。
- 重建 3D 界面
它读文章、理解 3D demo,重建可动画的完整 3D 界面,并思考构图、相机角度和解释文本。
Codex read the article, understood the 3D demo I was referring to, and recreated a full 3D interface it could animate.
- 额外预览工具
构建预览工具,支持播放、暂停、重复和从不同角度查看;作者未要求该工具。
Then it built me a little preview tool where I could play, pause, repeat the animation, and view it from different angles.
- 找回素材并合成
作者让 Astra 翻旧对话找回早期动画、在桌面找录屏、从 X 文章取最终动画,并组合成视频。
It found the pieces and combined them into a video without me having to point it to every file.
结果:得到可用于文章的动画和额外预览工具。
不能据此证明:不能证明跨环境稳定复现,也不能证明文件检索无遗漏或动画质量。
基于证据重建事件顺序,非逐字对话
照着一张 Appshot 重建可动画的 3D 界面
Astra/Codex 能否根据 Appshot、文章和代码库重建可动画 3D 界面,并额外构建预览工具?
- 实验设置
- 作者给 Astra 一个 Appshot、正在写的文章和 Codex app codebase;它读文章、理解 3D demo,重建可动画界面并构建预览工具。
- 样本与轮次
- 样本量或轮数未给出;未知。
- 模型
- Astra、Codex
- 判定指标
- 是否复现完整 3D 界面;预览工具是否支持播放、暂停、重复与换角度;无量化验收标准。
- 对照或基线
- 无明确对照。
结果:得到可动画 3D 界面和额外预览工具,预览工具并非他要求。
边界:单案例,未说明动画质量、文件检索完整性、失败次数或跨环境稳定性。
十张随手拍、零测量,Blender 里怎么还原出一个房间?
在 Blender 实验中,作者给了十张家庭酒吧的随手拍、没给任何尺寸,让它重建这个房间;凑效的办法是拿照片里的已知物体当尺子。Astra 在照片中找到鸡尾酒书这类参照物,用它们估算比例,然后逐个建模、逐个检查、放进场景反复迭代,做出房间、家具、架子、瓶子和玻璃器皿,连角落的椅子和乱拉的电线都在。
作者说单个物体都在 Blender 里,他才能逐件复查、继续调材质和灯光,并从不同角度看这个场景。在这个案例里,它用的是 Blender;没有说这是作者给所有 3D 项目的通用建议。
边界必须说清:这是单案例,没有测量基准、没有误差指标、没有独立验证。「比例准」是作者的判断,不等于重建尺寸精确,也不等于能复制到别的房间。
类比用照片里的已知物体估算比例像案件现场放一把尺子拍照,之后谁都能按这把尺子换算出其他东西的大小。
十张家庭酒吧照片,一把看不见的尺
作者给 Astra 十张随手拍的家庭酒吧照片,要求重建房间,未给测量。
- 比例估算
Astra 在照片中找到鸡尾酒书等参考物,并用它们估算比例。
It found reference objects in the photos, such as the cocktail books, and used them to estimate the scale.
- 建模与迭代
Astra 建模单个物体、分别检查、放入场景并持续迭代,构建房间、家具、架子、瓶子、玻璃器皿、角落椅子和随机电线。
It modeled individual objects, checked them separately, placed them in the scene, and kept iterating.
- 材质与灯光
作者继续迭代材质和灯光,并能打开场景从不同角度查看。
I kept iterating on the materials and lighting, and I could open the scene and look around from different angles.
结果:在 Blender 中重建出家庭酒吧场景。
不能据此证明:单案例,无测量与客观误差评估,不能证明尺寸准确或可泛化到其他房间。
基于证据重建事件顺序,非逐字对话
十张无测量照片能否在 Blender 里换回一个房间
Astra 能否仅凭十张无测量照片在 Blender 中重建家庭酒吧房间?
- 实验设置
- 作者给 Astra 十张家庭酒吧照片要求重建房间,未给测量;Astra 用照片中鸡尾酒书等参考物估算比例,逐个建模、分别检查、放入场景并迭代。
- 样本与轮次
- 10 张照片,1 个场景,迭代轮数未知。
- 模型
- GPT-6 Astra
- 判定指标
- 是否重建房间、家具、架子、瓶子、玻璃器皿、角落椅子和随机电线;比例由参考物估算。
- 对照或基线
- 无明确对照。
结果:构建出房间、家具、架子、瓶子、玻璃器皿,并包含角落椅子和随机电线,之后继续迭代材质与灯光。
边界:单案例;无测量基准与客观误差指标;作者评价主观;可泛化性未知。
这么吃能力的 3D 任务,是不是必须把推理档位开到最高?作者说恰恰相反。
为什么作者说别急着把推理开到 Max?
在作者的 Blender 实验中,Astra on Low 的结果被作者偏好于 Sol on Max:他更喜欢 Astra 在 Low 档下的结果,而不是 Sol 在 Max 档下的结果;他还说 Astra 不管档位高低都会验证自己的工作。据此给的建议是:不要因为以前用 Sol 跑高推理,就默认 Astra 也必须拉满;先试 Light/Low 或 Medium,看结果再决定是否需要更高推理。
附带的对比视频是上排 Sol、下排 Astra,各自从 Low 到 Max 逐档展示。但这是主观偏好排序:样本量、任务数量、评分标准或模型版本都没有给出,也没有说这些任务分别是什么难度。不能读成「Astra 的 Low 全面超过 Sol 的 Max」。
什么情况该开哪一档推理
- 条件你此前一直用 Sol 跑高推理结果容易顺着习惯把 Astra 也拉满可以怎么做先试 Light/Low 或 Medium,看结果再决定是否需要更高推理
- 条件任务是 Blender 这类 3D 场景结果作者更喜欢 Astra 在 Low 档的结果,胜过 Sol 在 Max 档可以怎么做先从中低档跑一版,再决定要不要加档
- 条件任务在旧模型上失败过、你已经放弃结果乐高模型从数小时迭代变成约十分钟拿到第一版可以怎么做把旧任务拿出来用 Astra 重试一次
- 条件你已经为旧模型写过配套 skill结果部分旧 skill 反而妨碍 Astra,去掉后效果更好可以怎么做先不带 skill 跑一遍,再判断是否需要挂回
适用范围:条件与结果均来自作者个人经验描述;行动建议依其说法归纳,不构成可复现的性能承诺。
Astra 的 Low 档对上 Sol 的 Max 档
在 Blender 任务中,Astra 的 Low 推理档位与 Sol 的 Max 档位相比结果如何?
- 实验设置
- 作者进行 Blender 实验,对比视频上排为 Sol 从 Low 到 Max,下排为 Astra 从 Low 到 Max。
- 样本与轮次
- 任务数量、样本量或轮数未给出;未知。
- 模型
- Astra、Sol
- 判定指标
- 作者主观偏好;视频逐档视觉对比,无量化评分。
- 对照或基线
- 以 Sol 作为对照。
结果:作者说,有 Astra on Low 的结果优于 Sol on Max。
边界:无样本量、无客观指标、任务细节未知,属个人偏好,不能外推为普遍性能结论。
自检这件事它做到什么程度,又该在哪里叫停?
它会自己检查工作,那什么时候该喊停?
它会主动验证任务到底做完了没有:做游戏可能自己试玩,让它优化什么可能自己搭环境测优化是否生效,剪视频会去看单帧甚至声音波形。最具体的一例是发布文章的标题图——它用浏览器读了 X 实时文章页面的代码,确认头图要求,找到 5:2 的比例和 1200 × 480 的尺寸。
可操作的做法是明确自检范围:只想要一个自己试玩的原型,就明说只要原型;想让它把游戏跑通并修掉发现的问题,也得明说。收尾时可以让它把你在意的检查过一遍,然后报告发现了什么、还有什么没解决。
这里同样只有行为倾向的概括:自检成功率、误报率或失败案例都没有给出,X 的页面规格也可能随时间变化。
类比自检范围要由使用者划像让装修队验收:可以只检查墙面,也可以逐项验收并出问题清单,但得你开口说清。
为一张头图,先去读 X 的页面代码
发布文章的标题图交给 Astra 处理,它需要确认头图规格。
- 接到任务
发布文章的标题图交给 Astra 处理,它需要确认头图规格。
- 检查实时页面代码
Astra 使用浏览器操作检查 X 实时文章页面代码,确认头图要求。
it used browser use to check the code behind X's live article page and confirm the header image requirements.
- 确认规格
找到 5:2 宽高比和 1200 × 480 封面。
It found a 5:2 aspect ratio and a 1200 × 480 cover.
结果:确认了标题图规格。
不能据此证明:不能证明该规格长期不变,也不能证明标题图设计质量。
基于证据重建事件顺序,非逐字对话
为了头图规格去读实时页面代码
Astra 是否会自行检查实时页面代码以确认头图规格?
- 实验设置
- 处理发布文章的标题图时,Astra 用浏览器操作检查 X 实时文章页面代码,确认头图要求。
- 样本与轮次
- 样本量或轮数未给出;未知。
- 模型
- Astra
- 判定指标
- 是否找到头图规格;找到 5:2 宽高比和 1200 × 480 封面。
- 对照或基线
- 无明确对照。
结果:Astra 确认了头图要求,并找到 5:2 宽高比与 1200 × 480 尺寸。
边界:单案例;页面规格可能变化;未独立验证。
这些经验里,有多少能直接搬到你自己的项目上?
这些经验能搬到你自己的项目上吗?
方法可以照着试,结论不能照抄。文章开头交代 GPT-6 Astra 已向所有 Pro、Enterprise 和 Business Premium 用户以及 API 开放,这句话同样只有一个来源;可用地区、价格和实际限制均未说明。作者本人是 OpenAI 开发者关系团队工程师,文章以 X Article 发布,图片和视频都来自同一条帖子,没有任何独立第三方验证。
可以照做的动作其实很少也很明确:把它干活会用到的应用交给它、给几段好参考、从 Light/Low 或 Medium 推理起步、告诉它成品应该是什么样以及要验证什么,然后看它能走到哪一步再补指令。
作者最后那句话是整篇的落点:如果你有个用旧模型试过又放弃的任务,拿 Astra 再试一次——只是别把一个人某次约十分钟的成绩,当成你自己的时间预算。
五条经验的证据覆盖情况
| 对象 | 作者案例 | 独立来源 | 可量化口径 |
|---|---|---|---|
| 乐高金门大桥 | 有 | 无 | 未知 |
| Thumbnail Studio 交互 | 有 | 无 | 未知 |
| Blender 房间重建 | 有 | 无 | 未知 |
| Astra Low 对 Sol Max | 有 | 无 | 未知 |
| 头图规格自检 | 有 | 无 | 未知 |



