同一句提示词,Claude 四个实例都吐出紫渐变落地页:问题不在模型

How to turn your AI into a world-class designer2026年9月1日 约 12 分钟

曾在 Apple(苹果)带队做设计与工程十二年的 Anshu Chimala,在 Lenny's Newsletter 于 2026 年 9 月 1 日刊出的客座文章《How to turn your AI into a world-class designer》里,把同一句落地页提示词交给四个 Claude Code 实例,得到的几乎总是紫色渐变、左文右图的同一套结构;他的解释是,大语言模型每一步只挑最可能的 token,训练中的人类偏好反馈又让它倾向一致、安全、迎合所有人偏好,因此不擅长设计,破解办法是从流程外部把随机性、品味和评审装进去。

ClaudeAI设计AI智能体提示词工程视频生成

一分钟速览

  • 四个 Claude 实例跑同一句提示词,落地页几乎都是紫渐变左文右图;改用随机字符串当灵感后,配色和字体明显分化。
  • 让另一个模型只看截图打分、9 分才收工,再补上图像与视频素材,通用 AI 味会被压下去。
  • 边界:全部演示都是作者自述,评分是同源模型自评,没有可运行产物或独立复现。

同一句提示词,四个实例给出同一套结构

2026 年 9 月 1 日,Lenny's Newsletter 刊出客座文章《How to turn your AI into a world-class designer》,作者是 Anshu Chimala。他每次在 X 上贴出 AI 做的设计演示,评论区几乎都会出现同一句质问:为什么模型愿意为你生成这些漂亮东西,我照着做却只拿到通用货色,你是不是偷偷换了模型。他的回答只有一句:模型没换,换的是他给模型的外部输入。他还给了一个比例:多数人只看到 AI 创造力的 1%,其余 99% 藏在用法里。这个比例是修辞,没有测量口径。

对比实验的第一组做得很朴素:他把同一句提示词「Build me a landing page for my productivity app」(给我搭一个生产力应用的落地页)交给四个 Claude Code 实例。四次输出几乎都是紫色渐变背景、左边文字右边图形、顶部导航栏,结构如出一辙。提示词里没有要求独特或变化,模型就退回它最熟悉的模式。他贴出的演示并不复杂:对话式卡路里记录应用用三条提示词做成,太空探索游戏用两条,动态落地页用三条。他还称这类智能体能在几小时里完成他团队过去要花几周的工作。

他的另一半底气来自履历:在 Apple(苹果)带队做设计与工程十二年,做未来 AI 产品的研究和原型。他把人类设计师身上见过的毛病直接套到了模型上——团队早期总是回到舒服的旧方案,是流程和纪律逼他们去边缘找新东西。迁移到 AI 之后,他的判断是:做好 AI 设计的关键不在于找一个更强的模型,而在于把模型自己不会带的东西从流程外部加进去。他把流程分成三段,松散地借用了设计行业常见的 Double Diamond(双钻模型)框架:探索方向、确立设计身份、打磨收尾。

原稿素材四个 Claude Code 实例跑同一句落地页提示词:四张页面都是紫色渐变、左文右图、顶部导航。

同一批模型、同一句提示词,结果为什么差这么远?答案藏在它怎么挑下一个字里。

模型不是不会设计,是每一步都挑最稳妥的答案

作者把设计平庸归到模型机制上:大语言模型是下一 token预测器,训练中的人类偏好反馈让它倾向做出一致、安全、迎合所有人偏好的选择,因此不擅长设计。写代码时它预测下一个最可能的 token 是优点,做设计时这变成缺陷。配色、排版、元素怎么摆,模型填进去的都是它认为最能让所有人满意的那一个 token;训练中的人类评分又把这种倾向固化下来,被反复挑中的是一致、安全、迎合普遍偏好的选择。设计于是层层叠加,越来越像一份设计委员会的产物。

好设计的路数正好相反:它从感受出发,目标是制造情绪反应,经常要打破规则,拿出人意料之外的东西。这正是模型天然最不擅长的部分。所谓的设计委员会,就像一份被所有部门各改一遍的稿子——没有人会反对,也没有人会记住。

所以口头要求「完全独特、每个设计决策完全随机」救不了场。模型能生成听起来随机的 token,但它并不是真的随机。那一轮输出里,配色、结构甚至同一个陶艺比喻仍在重复。随机性必须在模型之外产生,再喂进去。这套解释是作者对训练机制的概括,没有引用具体论文或实验。

类比设计委员会式的输出像一份被所有部门各改一遍的稿子,没人反对,也没人记住。

让模型先掷一次骰子:随机字符串怎么做

具体的做法是让模型先生成一个真正的随机字符串,再按这串字符决定设计方向。作者把这种方法称作 String Seed of Thought,说它由 Sakana AI 发布。这条归属没有独立材料可以核对,他给出的出处链接也无法查证。

他在提示词里写明三步:用 shell 脚本生成一长串随机字母数字;根据这串字符定义创意方向,包括配色、布局、字体,而且要透过表面去找子模式、特殊数字这类能激发灵感的东西;然后用自己的判断把它做成好看的东西。最后一句同样关键——不要把这串字符显示在设计里,它只作为灵感来源。

换成这个做法之后,输出的配色、字体和新想法明显分化。他的说法是,之前那批设计任何 Claude 用户都能拿到,这批则每次运行都不会重复。多样性仍由他肉眼判断,没有量化指标,也没有说明每种条件各跑了几次。

原稿素材改成先用随机字符串定方向之后,同一句提示词跑出的四套页面在配色、版式和字体上明显分化。

同一句提示词,三种要求的输出差别

第 3 节数据表格
提示条件看到的输出多样性判断
基础提示词,不提变化要求4 个实例跑出的落地页几乎都是紫色渐变、左文右图、顶部导航,结构基本相同几乎没有变化
追加「完全独特、决策完全随机」与基础版不同,但配色、结构、陶艺比喻仍在重复仍不具备多样性
先生成随机字符串,再据其定义配色、布局、字体方向配色、字体与新想法明显分化,作者称每次运行都不同明显提升
同一句提示词跑三种条件,只有外部随机串打破了雷同

用外部随机性(随机字符串种子)能否让同一句提示词下的设计输出摆脱重复的默认套路?

实验设置
对同一句落地页构建提示词测试三种条件:一、基础提示词;二、追加「完全独特、每个设计决策完全随机」;三、先用 shell 脚本生成随机字母数字串,据此确定配色、布局、字体方向,且不得把字符串暴露在设计里。判断由作者本人看输出完成。
样本与轮次
四个 Claude Code 实例运行同一提示词;材料未给出第二、三种条件的运行次数
模型
Claude Code、Claude Opus 5
判定指标
输出视觉多样性的定性比较;没有量化指标或评分口径
对照或基线
以条件一(不提变化要求)作为默认行为基线,条件二作为「口头要求随机」的对照

结果:条件一几乎总是紫色渐变、左文右图、相同结构;条件二输出虽与之前不同但仍不具多样性,配色、结构与陶艺比喻重复;条件三的配色、字体与新想法明显更多样,作者称每次运行结果都不同。

边界:样本仅四个实例、无重复次数与统计口径;多样性由作者主观判断、无盲评;模型版本与运行日期未披露;产物无法在材料中复核

换了随机种子,输出确实不再千篇一律,但它并不负责好看。那品味又从哪里来?

把只有你有的品味写进需求里

随机种子解决的是「每次都一样」,它不负责好看。第二样模型自己没有的东西,是你的品味。做法是把需求写得更具体、更大胆:先自己想到一个外部灵感,一款电子游戏、一种室内设计趋势、一件装置艺术,再描述希望它怎么影响输出。作者给的三个例子是:整体像素艺术主题、每一屏都像游戏截图的落地页;等距 3D 城市、用街区和建筑代表功能的落地页;布局极端不对称、配色与字体刻意不和谐、留白让人不适,但依然好看。

难点是这些点子从哪来。直接问 AI 要创意,拿到的还是所有人都会拿到的那批平均答案。他用一个三步法绕过去:先让 AI 一口气列出许多只有高层描述、故意缺细节的方向,目的只是刺激自己的想象;再把喜欢的几个可视化出来,观察自己对不同方向的实际反应,他举的例子是工业控制面板——「我想要有触感、咔哒作响、有声音的按钮;第一反应是卡通或拟物,但那样显得廉价;要一致的组件和恰到好处的细节;灰色渐变太无聊,需要更多质感和一些颜色」;最后让 AI 把收敛后的方向写成一串给智能体用的构建提示词。

这里的判断值得记下来:把 AI 生成的点子原样粘回 AI,很难得到独特结果,因为别人也能做同样的事;只有在中间主动转向,结果才只属于你。他也建议不要回避听起来很糟的点子——如果心里冒出「这肯定不行」,往往正是该试的方向,试完不行就丢掉,但把失败的提示词存起来,等新模型出来再跑一遍。这些是经验性建议,没有对照实验支撑。

原稿素材把灵感写成大胆需求后的输出之一:整站做成像素艺术游戏画面。
原稿素材第二个例子:等距 3D 城市,用街区和建筑表示产品功能。
原稿素材找点子三步法的第二步:把选中的方向可视化,观察自己的反应,再让 AI 细化。

自己给自己打分不算数,要换一个只看截图的模型

让写代码的智能体自己看自己的设计再改进,效果有限,因为它会参考自己的代码、过去的决定和当时的理由,很难退后一步看整体。作者的办法是另找一个模型当设计评审。流程是每轮截一张当前设计的图,把它交给一个全新上下文里的评审子智能体,除了截图什么都不给——不给代码、不给实现细节、也不给之前的迭代和评审记录。

评审要做四件事:判断这个设计想达到的美学是什么,设想一家顶级设计工作室会怎么执行它,指出当前最大的差距,再给一个 10 分制的分数。作者还规定评审要同时看整体结构和细节,对过度、冗余、一眼 AI 的模式扣分,反馈要具体,要有主见。完成的判定是评审独立给出 9 分或以上,而这个阈值不能写进评审提示词,否则它就会迎合;评审提示词每一轮保持一致。

在他的演示里,评审由 Claude Fable 5 担任,实现由 Claude Opus 5 完成,Fable 约占输出 token 的不到 10%。他估算,如果直接让 Fable 重做页面,成本会是两倍、耗时更长。这两个数字都没有说明统计工具、范围与运行次数,也无法换算成具体费用。

评审标准越客观越好。他给了三级示范:让评审「判断设计是否漂亮、是否像 AI 做的」太主观,每次结果都会飘;让评审「理解我们追求的美学、设想顶级工作室会怎么做、再对照打分」提供了一个稳定框架;最好的是给出五张图——四张专业设计样例加一张自家产品截图——让它按完成度和品味排序。参考图要说明是基线和情绪板,不是照抄对象。停止条件也要小心,先跑一到两轮看评分是否在收敛,再决定加不加,否则评审可能永远不满意、持续消耗 token。模型分工上,评审用大模型,因为参数越多设计感越好、想法分布越宽;执行可以用小模型,但别太小。

原稿素材确立设计身份阶段的示意图:把设计方向做深,而不是换一个新方向。

设计评审子智能体的一轮流程

第 1 / 4 步 · 截图

截取当前设计

每一轮先给当前页面截一张图,作为评审的唯一材料。

第 2 / 4 步 · 隔离

交给全新上下文的评审

只给截图,不给代码、实现细节,也不给过往的评审记录。

第 3 / 4 步 · 打分

评估美学并给出 10 分制评分

评审要设想顶级设计工作室会怎么执行这个美学,列出最大差距,再打分,并对明显 AI 感的模式扣分。

第 4 / 4 步 · 判定

评审独立给出 9 分以上才收工

这个阈值只写在执行智能体的指令里,不写进评审提示词;评审提示词每轮保持一致。

流程依据作者自述的 Claude Opus 5 执行、Claude Fable 5 评审的实践:评审模型只占输出 token 不到 10%,直接让它重做页面的成本约为两倍。迭代轮数未披露,评分属同类模型自评。

让独立评审子智能体把关,9 分才收工

让只看截图的设计评审子智能体介入迭代,能否把通用感强的设计提升为有个体识别度的设计?

实验设置
编码智能体每轮截取当前设计截图,把截图(不含代码、实现细节与历史评审)交给全新上下文中的评审;评审需评估设计追求的美学、设想顶级设计工作室会如何执行、列出最大差距并给出 10 分制评分。人工条件:评审关注整体结构与细节、惩罚过度或明显 AI 感的模式、反馈要具体、要有主见;停止条件为评审独立给出 9/10 或以上,且该阈值不写入评审提示词;同一套评审提示词每轮复用。
样本与轮次
未披露迭代轮数、设计数量与运行次数(未知)
模型
Claude Opus 5、Claude Fable 5
判定指标
评审子智能体的 10 分制评分(≥9/10 为完成);辅助观测为评审模型占输出 token 的比例与成本对比
对照或基线
无明确对照,比较对象是引入评审循环之前的同一批设计

结果:作者称每个设计获得了自身识别度并保留原有高层美学;评审模型占输出 token 不足 10%;若直接让评审模型重做页面,成本为两倍且耗时更长。

边界:评分为同源模型自评,无人类盲评与第三方验证;token 占比与成本倍数无统计口径与样本量;停止阈值可能诱导调参;未披露迭代轮数

评审能治掉一部分通用感,治不掉另一部分——整页的渐变和几何图形,因为写代码的智能体默认根本不碰图片。

图像的活交给图像模型,视频还能做页面过渡

写代码的智能体偏爱渐变、形状和基础图案,因为这些东西在代码里就能做出来,而它们恰恰是一眼看出 AI 生成的最大线索。接入图像生成有三条路。用 Codex、Antigravity 或 Grok Build 的人,可以直接让智能体使用内置的图像生成,它本来就会,只是不主动用。用 Claude Code 之类但手里有 ChatGPT 订阅的人,可以让智能体走 Codex CLI(命令行工具)生成图片,把费用记在订阅上而不是 API key 上。只有 Claude 或别的工具的人,最简单的办法是给智能体一个 OpenAI 或 Gemini 的 key。作者建议单独建一个带严格消费上限的 key 专门给智能体用,即使泄露或被滥用也能控制损失、随时吊销。如果经常往对话里粘 key,就把 key 放进一个被 gitignore 的 .env.agents 文件,并在 AGENTS.md 或 CLAUDE.md 里注明这是开发时用的、不能随产品发布。

视频模型有两个被低估的用法。第一种是把它当动画素材:生成一段纯色背景的循环片段,再用色键或视频抠像模型去掉背景,就能叠到界面任意位置而不像一段视频。要做出可信的玻璃折射,得先把玻璃视频渲染在页面背景色之上,把折射效果烘焙进去,再抠掉背景。第二种是把它当状态之间的过渡:许多视频模型可以在关键帧图像之间插值,两张产品静帧就能生成一段过渡片段,用户操作时播放,或者在滚动、滑动时逐帧擦除。他展示的行李箱演示页只用了一条提示词,页面依次呈现箱子悬在空中、落地弹开、内容物从上方落入三种状态,每一段过渡用上一段的末帧做种子保持连贯,滚动时逐段擦除;挑选模型时他建议选物理和一致性强的,比如 Seedance 2.5。

Claude Fable 5、Claude Opus 5、GPT-5.6 Sol、Seedance 2.5 这些名字目前没有可以核对的官方规格,演示也没有可运行的产物链接。实际效果与可用性无法验证。

原稿素材玻璃水晶素材的前后对比:静态几何图形换成会碎裂、缓慢旋转并带折射的循环片段。
原稿素材行李箱演示页:一条提示词串起箱子悬空、落地弹开、内容物从上落入三段滚动状态。

视频模型在界面里的两种用法

切换方案,查看它分别改变哪一层问题。

循环动画素材

作用对象 · 需要动态质感的页面元素,例如玻璃、水晶、光效

它怎样起作用
生成纯色背景的循环片段,用色键或视频抠像模型去掉背景,再叠加到任意界面位置;玻璃折射要先把视频渲染在页面背景色上,再抠掉背景
希望带来什么变化
代码难以复现的焦散反射、玻璃折射与复杂物理运动
真正落地还缺什么
不同页面背景下的通用性与性能开销没有数据
状态之间的过渡

作用对象 · 多屏产品展示、需要随滚动或滑动变化的页面

它怎样起作用
用关键帧插值在两张产品静帧之间生成过渡片段,用户操作时播放或随滚动逐帧擦除,每一段用上一段末帧做种子保持连贯
希望带来什么变化
滚动时过渡流畅连贯,行李箱演示只用了一条提示词
真正落地还缺什么
跨浏览器一致性与对用户留存的真实影响未经验证

行李箱演示页:一条提示词串起三段滚动过渡

作者用 GPT-5.6 Sol 在 Codex 中以一条提示词构建行李箱产品的演示页,要求用视频模型生成多屏状态之间的交互过渡。

  1. 定义状态序列

    页面依次呈现行李箱悬在空中、落地并弹开、内容物从上部落入箱内三种状态,垂直运动需符合滚动直觉。

    Initially, have the suitcase floating high up in the air
  2. 生成首帧与过渡片段

    先用图像生成能力产出初始帧,再生成从该帧动画到下一状态的视频,并用该片段的末帧作为下一段过渡的种子以保持连续。

    Use the final frame of that video to seed the next transition so that it continues seamlessly.
  3. 随滚动擦除播放

    用户滚动时逐段擦除播放这些过渡。

    Scrub through the transitions one by one as the user scrolls.

结果:过渡片段随滚动流畅擦除,作者称整个页面只用一条提示词完成。

不能据此证明:不能证明该效果在真实产品中的性能、跨浏览器一致性或对用户留存的任何影响,也没有可复核链接。

基于证据重建事件顺序,非逐字对话

把静态图换成一段会折射的玻璃循环动画

作者在既有设计上要求用图像生成增强个性,并把页面图像替换为带折射与阴影的玻璃水晶循环动画。

  1. 提出增强要求

    把页面上的静态图像换成更有趣的循环视频片段,用图像生成来增加个性。

  2. 描述想要的物理效果

    让水晶碎裂并缓慢旋转,带玻璃折射、阴影与光照效果。

    Have the crystal splinter apart and slowly spin around.
  3. 折射烘焙与去背

    先把玻璃视频渲染在页面背景色之上以烘焙折射效果,再用视频抠像模型移除背景,得到可叠加到任意 UI 位置的动画。

    then remove the background with a video matting model.

结果:作者称得到比纯代码实现更丰富的焦散反射、玻璃折射与复杂物理运动效果。

不能据此证明:为单次演示的作者评价,不能证明该类动画在不同页面背景下的通用性与性能开销;所调用的具体视频模型未全部披露。

基于证据重建事件顺序,非逐字对话

效果堆到这里,最反直觉的一步是往回收:把东西删掉。

AI 只会加东西,减法得你自己来

删减是这套流程里最反直觉的一步,也是作者花时间最多的一步。他做卡路里记录应用时,描述完功能并明确要求「干净、极简的设计」,Claude 给出的初版仍然带着一堆无用的东西:背景和进度条上的粉色发光、文字上随机的颜色和高亮、展示一天食物时多余的标签和空白(图片本身已经说明了一切),以及比内置 iOS 组件更难看的自定义按钮和输入框。

他的指令很直接:把布局简化成以图像为中心的网格,去掉渐变、发光和多余的容器,追求真正 Apple 原生的极简。重做之后,他判断结果明显更好——更有主见,让图像自己说话,改用原生 iOS 组件,颜色和渐变收敛了,文字更小更简洁。

原因在模型的偏好方向:它爱加东西、不爱减东西,而把一个设计剥掉一层往往意味着删代码,是风险更高的动作,模型会回避。所以删减必须由人来推动,这也像收拾行李——助手只会往里塞,最后清空一半得你自己动手。作者说,打磨 AI 设计时他的大部分精力都花在删东西上。判断标准很简单:看一遍设计,问哪些元素是真的需要存在;屏幕上的东西更少,用户反而更容易被抓住。这个案例只反映他对单一应用两个版本的审美判断,没有用户测试或性能数据。

原稿素材作者明确要求「干净、极简」之后,模型仍然给出粉色发光背景、彩色文字和多余标签的初版。
原稿素材删掉渐变、发光与多余容器之后:布局改成以图像为中心的网格,控件回归系统原生。
类比AI 爱加不爱减像收拾行李时只会往里塞东西的助手,最后清空一半还得自己动手。

同一个卡路里应用,两次生成的差别

对照
  1. 初始版本
    提出的要求
    描述功能,并明确要求「干净、极简的设计」
    实际出现的东西
    背景与进度条的粉色发光、文字随机配色与高亮、展示一天食物时多余的标签和空白、不如内置 iOS 组件的自定义控件
  2. 按删减指令重做
    提出的要求
    布局简化为以图像为中心的网格、去掉渐变发光与多余容器、追求 Apple 原生极简
    实际出现的东西
    作者判断更有主见,让图像自己说话,使用原生 iOS 组件,颜色和渐变收敛,文字更小更简洁

一个卡路里记录应用:要求了极简,还是被塞满了

作者用 Claude 构建卡路里记录应用,描述了应用功能,并明确要求「干净、极简的设计」。

  1. 初始设计

    结果仍是全 AI 生成,但带粉色发光背景与进度条发光、文字随机配色与高亮、展示每日食物时多余的标签和空白,以及不如内置 iOS 组件的自定义按钮与输入框。

    Pink glowy effects in the background and on the progress bar
  2. 人工删减指令

    作者要求把布局简化为以图像为中心的网格,去掉渐变、发光与多余容器,追求 Apple 原生的极简审美。

    Simplify the layout into an image-centric grid
  3. 精简后结果

    作者判断结果明显更好:更有主见,让图像自己说话,使用原生 iOS 组件,颜色和渐变收敛,文字更小更简洁。

    This is good design.

结果:去掉 AI 常见的冗余元素后,设计被作者评价为更接近可用、克制的成品。

不能据此证明:只反映作者对单一应用两个版本的审美判断,不能证明其他模型、提示词或更广用户群会得到同样结果,也不含用户测试与性能数据。

基于证据重建事件顺序,非逐字对话

这套流程看起来完整,但它能证明的东西比表面少。

能站住的是机制,站不住的是效果

能站得住的部分在机制层面:一个每一步都只挑最可能 token 的模型,天然会收敛到人人能接受的方案,这个倾向不会因为模型变大而消失。能站住的操作结论也很窄——随机性、品味、独立评审、非代码素材和删减,这五样东西模型都不会自己带来,需要人在流程里给它们安排位置:随机性来自外部字符串,品味来自你自己的反应和需求描述,评审来自另一个只看截图的模型,素材来自图像与视频模型,删减从你手上过。

站不住的部分同样要说清。所有演示都是 Anshu Chimala 的自述:没有可运行产物,没有完整提示词,没有第三方复现,提示词条数(三条、两条、一条)也是他自己的说法。评分由同类模型自评得出,没有人工盲评,也没说明迭代了多少轮。「评审模型占输出 token 不到 10%」和「直接重做成本翻倍」没有给出统计口径和样本量。Claude Fable 5、Claude Opus 5、GPT-5.6 Sol、Seedance 2.5 这些名称没有可以核对的官方规格;「模型越大设计感越好」只是作者的选型经验。

所以回到开头那句质问:不是模型对别人更偏心,而是你交给它的东西里缺了它自己不会有的部分。什么条件会改变这个判断?如果模型开始把这些行为变成默认——自带真正的随机探索、自带视觉评审、默认调用图像和视频工具——这套手工外挂的价值就会下降。作者给的实用做法正好用在这里:把失败的提示词存下来,等新模型出来再跑一遍,你会知道哪些环节已经可以卸载了。