同一句提示词,四个实例给出同一套结构
2026 年 9 月 1 日,Lenny's Newsletter 刊出客座文章《How to turn your AI into a world-class designer》,作者是 Anshu Chimala。他每次在 X 上贴出 AI 做的设计演示,评论区几乎都会出现同一句质问:为什么模型愿意为你生成这些漂亮东西,我照着做却只拿到通用货色,你是不是偷偷换了模型。他的回答只有一句:模型没换,换的是他给模型的外部输入。他还给了一个比例:多数人只看到 AI 创造力的 1%,其余 99% 藏在用法里。这个比例是修辞,没有测量口径。
对比实验的第一组做得很朴素:他把同一句提示词「Build me a landing page for my productivity app」(给我搭一个生产力应用的落地页)交给四个 Claude Code 实例。四次输出几乎都是紫色渐变背景、左边文字右边图形、顶部导航栏,结构如出一辙。提示词里没有要求独特或变化,模型就退回它最熟悉的模式。他贴出的演示并不复杂:对话式卡路里记录应用用三条提示词做成,太空探索游戏用两条,动态落地页用三条。他还称这类智能体能在几小时里完成他团队过去要花几周的工作。
他的另一半底气来自履历:在 Apple(苹果)带队做设计与工程十二年,做未来 AI 产品的研究和原型。他把人类设计师身上见过的毛病直接套到了模型上——团队早期总是回到舒服的旧方案,是流程和纪律逼他们去边缘找新东西。迁移到 AI 之后,他的判断是:做好 AI 设计的关键不在于找一个更强的模型,而在于把模型自己不会带的东西从流程外部加进去。他把流程分成三段,松散地借用了设计行业常见的 Double Diamond(双钻模型)框架:探索方向、确立设计身份、打磨收尾。
同一批模型、同一句提示词,结果为什么差这么远?答案藏在它怎么挑下一个字里。
模型不是不会设计,是每一步都挑最稳妥的答案
作者把设计平庸归到模型机制上:大语言模型是下一 token预测器,训练中的人类偏好反馈让它倾向做出一致、安全、迎合所有人偏好的选择,因此不擅长设计。写代码时它预测下一个最可能的 token 是优点,做设计时这变成缺陷。配色、排版、元素怎么摆,模型填进去的都是它认为最能让所有人满意的那一个 token;训练中的人类评分又把这种倾向固化下来,被反复挑中的是一致、安全、迎合普遍偏好的选择。设计于是层层叠加,越来越像一份设计委员会的产物。
好设计的路数正好相反:它从感受出发,目标是制造情绪反应,经常要打破规则,拿出人意料之外的东西。这正是模型天然最不擅长的部分。所谓的设计委员会,就像一份被所有部门各改一遍的稿子——没有人会反对,也没有人会记住。
所以口头要求「完全独特、每个设计决策完全随机」救不了场。模型能生成听起来随机的 token,但它并不是真的随机。那一轮输出里,配色、结构甚至同一个陶艺比喻仍在重复。随机性必须在模型之外产生,再喂进去。这套解释是作者对训练机制的概括,没有引用具体论文或实验。
类比设计委员会式的输出像一份被所有部门各改一遍的稿子,没人反对,也没人记住。
让模型先掷一次骰子:随机字符串怎么做
具体的做法是让模型先生成一个真正的随机字符串,再按这串字符决定设计方向。作者把这种方法称作 String Seed of Thought,说它由 Sakana AI 发布。这条归属没有独立材料可以核对,他给出的出处链接也无法查证。
他在提示词里写明三步:用 shell 脚本生成一长串随机字母数字;根据这串字符定义创意方向,包括配色、布局、字体,而且要透过表面去找子模式、特殊数字这类能激发灵感的东西;然后用自己的判断把它做成好看的东西。最后一句同样关键——不要把这串字符显示在设计里,它只作为灵感来源。
换成这个做法之后,输出的配色、字体和新想法明显分化。他的说法是,之前那批设计任何 Claude 用户都能拿到,这批则每次运行都不会重复。多样性仍由他肉眼判断,没有量化指标,也没有说明每种条件各跑了几次。
同一句提示词,三种要求的输出差别
| 提示条件 | 看到的输出 | 多样性判断 |
|---|---|---|
| 基础提示词,不提变化要求 | 4 个实例跑出的落地页几乎都是紫色渐变、左文右图、顶部导航,结构基本相同 | 几乎没有变化 |
| 追加「完全独特、决策完全随机」 | 与基础版不同,但配色、结构、陶艺比喻仍在重复 | 仍不具备多样性 |
| 先生成随机字符串,再据其定义配色、布局、字体方向 | 配色、字体与新想法明显分化,作者称每次运行都不同 | 明显提升 |
同一句提示词跑三种条件,只有外部随机串打破了雷同
用外部随机性(随机字符串种子)能否让同一句提示词下的设计输出摆脱重复的默认套路?
- 实验设置
- 对同一句落地页构建提示词测试三种条件:一、基础提示词;二、追加「完全独特、每个设计决策完全随机」;三、先用 shell 脚本生成随机字母数字串,据此确定配色、布局、字体方向,且不得把字符串暴露在设计里。判断由作者本人看输出完成。
- 样本与轮次
- 四个 Claude Code 实例运行同一提示词;材料未给出第二、三种条件的运行次数
- 模型
- Claude Code、Claude Opus 5
- 判定指标
- 输出视觉多样性的定性比较;没有量化指标或评分口径
- 对照或基线
- 以条件一(不提变化要求)作为默认行为基线,条件二作为「口头要求随机」的对照
结果:条件一几乎总是紫色渐变、左文右图、相同结构;条件二输出虽与之前不同但仍不具多样性,配色、结构与陶艺比喻重复;条件三的配色、字体与新想法明显更多样,作者称每次运行结果都不同。
边界:样本仅四个实例、无重复次数与统计口径;多样性由作者主观判断、无盲评;模型版本与运行日期未披露;产物无法在材料中复核
换了随机种子,输出确实不再千篇一律,但它并不负责好看。那品味又从哪里来?
把只有你有的品味写进需求里
随机种子解决的是「每次都一样」,它不负责好看。第二样模型自己没有的东西,是你的品味。做法是把需求写得更具体、更大胆:先自己想到一个外部灵感,一款电子游戏、一种室内设计趋势、一件装置艺术,再描述希望它怎么影响输出。作者给的三个例子是:整体像素艺术主题、每一屏都像游戏截图的落地页;等距 3D 城市、用街区和建筑代表功能的落地页;布局极端不对称、配色与字体刻意不和谐、留白让人不适,但依然好看。
难点是这些点子从哪来。直接问 AI 要创意,拿到的还是所有人都会拿到的那批平均答案。他用一个三步法绕过去:先让 AI 一口气列出许多只有高层描述、故意缺细节的方向,目的只是刺激自己的想象;再把喜欢的几个可视化出来,观察自己对不同方向的实际反应,他举的例子是工业控制面板——「我想要有触感、咔哒作响、有声音的按钮;第一反应是卡通或拟物,但那样显得廉价;要一致的组件和恰到好处的细节;灰色渐变太无聊,需要更多质感和一些颜色」;最后让 AI 把收敛后的方向写成一串给智能体用的构建提示词。
这里的判断值得记下来:把 AI 生成的点子原样粘回 AI,很难得到独特结果,因为别人也能做同样的事;只有在中间主动转向,结果才只属于你。他也建议不要回避听起来很糟的点子——如果心里冒出「这肯定不行」,往往正是该试的方向,试完不行就丢掉,但把失败的提示词存起来,等新模型出来再跑一遍。这些是经验性建议,没有对照实验支撑。
自己给自己打分不算数,要换一个只看截图的模型
让写代码的智能体自己看自己的设计再改进,效果有限,因为它会参考自己的代码、过去的决定和当时的理由,很难退后一步看整体。作者的办法是另找一个模型当设计评审。流程是每轮截一张当前设计的图,把它交给一个全新上下文里的评审子智能体,除了截图什么都不给——不给代码、不给实现细节、也不给之前的迭代和评审记录。
评审要做四件事:判断这个设计想达到的美学是什么,设想一家顶级设计工作室会怎么执行它,指出当前最大的差距,再给一个 10 分制的分数。作者还规定评审要同时看整体结构和细节,对过度、冗余、一眼 AI 的模式扣分,反馈要具体,要有主见。完成的判定是评审独立给出 9 分或以上,而这个阈值不能写进评审提示词,否则它就会迎合;评审提示词每一轮保持一致。
在他的演示里,评审由 Claude Fable 5 担任,实现由 Claude Opus 5 完成,Fable 约占输出 token 的不到 10%。他估算,如果直接让 Fable 重做页面,成本会是两倍、耗时更长。这两个数字都没有说明统计工具、范围与运行次数,也无法换算成具体费用。
评审标准越客观越好。他给了三级示范:让评审「判断设计是否漂亮、是否像 AI 做的」太主观,每次结果都会飘;让评审「理解我们追求的美学、设想顶级工作室会怎么做、再对照打分」提供了一个稳定框架;最好的是给出五张图——四张专业设计样例加一张自家产品截图——让它按完成度和品味排序。参考图要说明是基线和情绪板,不是照抄对象。停止条件也要小心,先跑一到两轮看评分是否在收敛,再决定加不加,否则评审可能永远不满意、持续消耗 token。模型分工上,评审用大模型,因为参数越多设计感越好、想法分布越宽;执行可以用小模型,但别太小。
设计评审子智能体的一轮流程
截取当前设计
每一轮先给当前页面截一张图,作为评审的唯一材料。
交给全新上下文的评审
只给截图,不给代码、实现细节,也不给过往的评审记录。
评估美学并给出 10 分制评分
评审要设想顶级设计工作室会怎么执行这个美学,列出最大差距,再打分,并对明显 AI 感的模式扣分。
评审独立给出 9 分以上才收工
这个阈值只写在执行智能体的指令里,不写进评审提示词;评审提示词每轮保持一致。
流程依据作者自述的 Claude Opus 5 执行、Claude Fable 5 评审的实践:评审模型只占输出 token 不到 10%,直接让它重做页面的成本约为两倍。迭代轮数未披露,评分属同类模型自评。
让独立评审子智能体把关,9 分才收工
让只看截图的设计评审子智能体介入迭代,能否把通用感强的设计提升为有个体识别度的设计?
- 实验设置
- 编码智能体每轮截取当前设计截图,把截图(不含代码、实现细节与历史评审)交给全新上下文中的评审;评审需评估设计追求的美学、设想顶级设计工作室会如何执行、列出最大差距并给出 10 分制评分。人工条件:评审关注整体结构与细节、惩罚过度或明显 AI 感的模式、反馈要具体、要有主见;停止条件为评审独立给出 9/10 或以上,且该阈值不写入评审提示词;同一套评审提示词每轮复用。
- 样本与轮次
- 未披露迭代轮数、设计数量与运行次数(未知)
- 模型
- Claude Opus 5、Claude Fable 5
- 判定指标
- 评审子智能体的 10 分制评分(≥9/10 为完成);辅助观测为评审模型占输出 token 的比例与成本对比
- 对照或基线
- 无明确对照,比较对象是引入评审循环之前的同一批设计
结果:作者称每个设计获得了自身识别度并保留原有高层美学;评审模型占输出 token 不足 10%;若直接让评审模型重做页面,成本为两倍且耗时更长。
边界:评分为同源模型自评,无人类盲评与第三方验证;token 占比与成本倍数无统计口径与样本量;停止阈值可能诱导调参;未披露迭代轮数
评审能治掉一部分通用感,治不掉另一部分——整页的渐变和几何图形,因为写代码的智能体默认根本不碰图片。
图像的活交给图像模型,视频还能做页面过渡
写代码的智能体偏爱渐变、形状和基础图案,因为这些东西在代码里就能做出来,而它们恰恰是一眼看出 AI 生成的最大线索。接入图像生成有三条路。用 Codex、Antigravity 或 Grok Build 的人,可以直接让智能体使用内置的图像生成,它本来就会,只是不主动用。用 Claude Code 之类但手里有 ChatGPT 订阅的人,可以让智能体走 Codex CLI(命令行工具)生成图片,把费用记在订阅上而不是 API key 上。只有 Claude 或别的工具的人,最简单的办法是给智能体一个 OpenAI 或 Gemini 的 key。作者建议单独建一个带严格消费上限的 key 专门给智能体用,即使泄露或被滥用也能控制损失、随时吊销。如果经常往对话里粘 key,就把 key 放进一个被 gitignore 的 .env.agents 文件,并在 AGENTS.md 或 CLAUDE.md 里注明这是开发时用的、不能随产品发布。
视频模型有两个被低估的用法。第一种是把它当动画素材:生成一段纯色背景的循环片段,再用色键或视频抠像模型去掉背景,就能叠到界面任意位置而不像一段视频。要做出可信的玻璃折射,得先把玻璃视频渲染在页面背景色之上,把折射效果烘焙进去,再抠掉背景。第二种是把它当状态之间的过渡:许多视频模型可以在关键帧图像之间插值,两张产品静帧就能生成一段过渡片段,用户操作时播放,或者在滚动、滑动时逐帧擦除。他展示的行李箱演示页只用了一条提示词,页面依次呈现箱子悬在空中、落地弹开、内容物从上方落入三种状态,每一段过渡用上一段的末帧做种子保持连贯,滚动时逐段擦除;挑选模型时他建议选物理和一致性强的,比如 Seedance 2.5。
Claude Fable 5、Claude Opus 5、GPT-5.6 Sol、Seedance 2.5 这些名字目前没有可以核对的官方规格,演示也没有可运行的产物链接。实际效果与可用性无法验证。
视频模型在界面里的两种用法
切换方案,查看它分别改变哪一层问题。
循环动画素材
作用对象 · 需要动态质感的页面元素,例如玻璃、水晶、光效
- 它怎样起作用
- 生成纯色背景的循环片段,用色键或视频抠像模型去掉背景,再叠加到任意界面位置;玻璃折射要先把视频渲染在页面背景色上,再抠掉背景
- 希望带来什么变化
- 代码难以复现的焦散反射、玻璃折射与复杂物理运动
- 真正落地还缺什么
- 不同页面背景下的通用性与性能开销没有数据
状态之间的过渡
作用对象 · 多屏产品展示、需要随滚动或滑动变化的页面
- 它怎样起作用
- 用关键帧插值在两张产品静帧之间生成过渡片段,用户操作时播放或随滚动逐帧擦除,每一段用上一段末帧做种子保持连贯
- 希望带来什么变化
- 滚动时过渡流畅连贯,行李箱演示只用了一条提示词
- 真正落地还缺什么
- 跨浏览器一致性与对用户留存的真实影响未经验证
行李箱演示页:一条提示词串起三段滚动过渡
作者用 GPT-5.6 Sol 在 Codex 中以一条提示词构建行李箱产品的演示页,要求用视频模型生成多屏状态之间的交互过渡。
- 定义状态序列
页面依次呈现行李箱悬在空中、落地并弹开、内容物从上部落入箱内三种状态,垂直运动需符合滚动直觉。
Initially, have the suitcase floating high up in the air
- 生成首帧与过渡片段
先用图像生成能力产出初始帧,再生成从该帧动画到下一状态的视频,并用该片段的末帧作为下一段过渡的种子以保持连续。
Use the final frame of that video to seed the next transition so that it continues seamlessly.
- 随滚动擦除播放
用户滚动时逐段擦除播放这些过渡。
Scrub through the transitions one by one as the user scrolls.
结果:过渡片段随滚动流畅擦除,作者称整个页面只用一条提示词完成。
不能据此证明:不能证明该效果在真实产品中的性能、跨浏览器一致性或对用户留存的任何影响,也没有可复核链接。
基于证据重建事件顺序,非逐字对话
把静态图换成一段会折射的玻璃循环动画
作者在既有设计上要求用图像生成增强个性,并把页面图像替换为带折射与阴影的玻璃水晶循环动画。
- 提出增强要求
把页面上的静态图像换成更有趣的循环视频片段,用图像生成来增加个性。
- 描述想要的物理效果
让水晶碎裂并缓慢旋转,带玻璃折射、阴影与光照效果。
Have the crystal splinter apart and slowly spin around.
- 折射烘焙与去背
先把玻璃视频渲染在页面背景色之上以烘焙折射效果,再用视频抠像模型移除背景,得到可叠加到任意 UI 位置的动画。
then remove the background with a video matting model.
结果:作者称得到比纯代码实现更丰富的焦散反射、玻璃折射与复杂物理运动效果。
不能据此证明:为单次演示的作者评价,不能证明该类动画在不同页面背景下的通用性与性能开销;所调用的具体视频模型未全部披露。
基于证据重建事件顺序,非逐字对话
效果堆到这里,最反直觉的一步是往回收:把东西删掉。
AI 只会加东西,减法得你自己来
删减是这套流程里最反直觉的一步,也是作者花时间最多的一步。他做卡路里记录应用时,描述完功能并明确要求「干净、极简的设计」,Claude 给出的初版仍然带着一堆无用的东西:背景和进度条上的粉色发光、文字上随机的颜色和高亮、展示一天食物时多余的标签和空白(图片本身已经说明了一切),以及比内置 iOS 组件更难看的自定义按钮和输入框。
他的指令很直接:把布局简化成以图像为中心的网格,去掉渐变、发光和多余的容器,追求真正 Apple 原生的极简。重做之后,他判断结果明显更好——更有主见,让图像自己说话,改用原生 iOS 组件,颜色和渐变收敛了,文字更小更简洁。
原因在模型的偏好方向:它爱加东西、不爱减东西,而把一个设计剥掉一层往往意味着删代码,是风险更高的动作,模型会回避。所以删减必须由人来推动,这也像收拾行李——助手只会往里塞,最后清空一半得你自己动手。作者说,打磨 AI 设计时他的大部分精力都花在删东西上。判断标准很简单:看一遍设计,问哪些元素是真的需要存在;屏幕上的东西更少,用户反而更容易被抓住。这个案例只反映他对单一应用两个版本的审美判断,没有用户测试或性能数据。
类比AI 爱加不爱减像收拾行李时只会往里塞东西的助手,最后清空一半还得自己动手。
同一个卡路里应用,两次生成的差别
- 初始版本
- 提出的要求
- 描述功能,并明确要求「干净、极简的设计」
- 实际出现的东西
- 背景与进度条的粉色发光、文字随机配色与高亮、展示一天食物时多余的标签和空白、不如内置 iOS 组件的自定义控件
- 按删减指令重做
- 提出的要求
- 布局简化为以图像为中心的网格、去掉渐变发光与多余容器、追求 Apple 原生极简
- 实际出现的东西
- 作者判断更有主见,让图像自己说话,使用原生 iOS 组件,颜色和渐变收敛,文字更小更简洁
一个卡路里记录应用:要求了极简,还是被塞满了
作者用 Claude 构建卡路里记录应用,描述了应用功能,并明确要求「干净、极简的设计」。
- 初始设计
结果仍是全 AI 生成,但带粉色发光背景与进度条发光、文字随机配色与高亮、展示每日食物时多余的标签和空白,以及不如内置 iOS 组件的自定义按钮与输入框。
Pink glowy effects in the background and on the progress bar
- 人工删减指令
作者要求把布局简化为以图像为中心的网格,去掉渐变、发光与多余容器,追求 Apple 原生的极简审美。
Simplify the layout into an image-centric grid
- 精简后结果
作者判断结果明显更好:更有主见,让图像自己说话,使用原生 iOS 组件,颜色和渐变收敛,文字更小更简洁。
This is good design.
结果:去掉 AI 常见的冗余元素后,设计被作者评价为更接近可用、克制的成品。
不能据此证明:只反映作者对单一应用两个版本的审美判断,不能证明其他模型、提示词或更广用户群会得到同样结果,也不含用户测试与性能数据。
基于证据重建事件顺序,非逐字对话
这套流程看起来完整,但它能证明的东西比表面少。
能站住的是机制,站不住的是效果
能站得住的部分在机制层面:一个每一步都只挑最可能 token 的模型,天然会收敛到人人能接受的方案,这个倾向不会因为模型变大而消失。能站住的操作结论也很窄——随机性、品味、独立评审、非代码素材和删减,这五样东西模型都不会自己带来,需要人在流程里给它们安排位置:随机性来自外部字符串,品味来自你自己的反应和需求描述,评审来自另一个只看截图的模型,素材来自图像与视频模型,删减从你手上过。
站不住的部分同样要说清。所有演示都是 Anshu Chimala 的自述:没有可运行产物,没有完整提示词,没有第三方复现,提示词条数(三条、两条、一条)也是他自己的说法。评分由同类模型自评得出,没有人工盲评,也没说明迭代了多少轮。「评审模型占输出 token 不到 10%」和「直接重做成本翻倍」没有给出统计口径和样本量。Claude Fable 5、Claude Opus 5、GPT-5.6 Sol、Seedance 2.5 这些名称没有可以核对的官方规格;「模型越大设计感越好」只是作者的选型经验。
所以回到开头那句质问:不是模型对别人更偏心,而是你交给它的东西里缺了它自己不会有的部分。什么条件会改变这个判断?如果模型开始把这些行为变成默认——自带真正的随机探索、自带视觉评审、默认调用图像和视频工具——这套手工外挂的价值就会下降。作者给的实用做法正好用在这里:把失败的提示词存下来,等新模型出来再跑一遍,你会知道哪些环节已经可以卸载了。



