15 人 14 天做完一部 AI 长片,账单里 80% 是算力
《地狱苦旅》(Hell Grind)是一部 AI 生成的长片。没有摄像机,没有真人演员,也没有实体布景。制作团队为15个人,用了 14 天完成;预算 50 万美元,其中约 80% 花在算力上,也就是反复调用模型生成画面。
和片子一起公开的还有一份罕见的档案:11.5 万条生成记录、108 个项目文件夹。提示词、模型、参数、生成结果,包括未达预期的镜头,全部摊开。成片采用约 960 个镜头;前 25 分钟的官方数字是 16,181 次生成换来 253 个最终镜头,筛选比 64:1。
工具链也一并公开:视频和语音主要用 Seedance 2.0 生成,角色面部和场景资产用 Soul Cinema 做定妆照和场景参考,编辑图片用 Nano Banana Pro 和 Seedream 4.5,碰到文字、特殊道具或场景反角度则用 GPT Image 2。
有两处口径要分开看。片长方面,一份中文整理写 95 分钟,Higgsfield 官方项目页的标题写的是 90 分钟,两个数字不一致,片头片尾怎么算也没有说明。来源方面,这份中文整理标注自己依据 Higgsfield Studio 公开的《Hell Grind》项目档案写成;预算、生成记录数、筛选比都出自项目方公开口径与这份整理,成片质量、观众反馈、商业表现都没有出现在材料里,目前也没有独立第三方复核。
同一部电影,两套说法
| 对比项 | 中文整理文档 | Higgsfield 官方项目页 |
|---|---|---|
| 片长 | 95 分钟 | 90 分钟(页面标题) |
| 公开范围 | 称公开 108 个项目文件夹、11.5 万条生成记录 | 标题写 fully open-sourced,正文未列明细 |
| 预算与工具链 | 50 万美元、约 80% 算力,并列出 Seedance 2.0 等工具 | 当前可读到的只有标题与导航,未出现这些数字 |
| 可核验程度 | 作者未知,属对项目档案的整理转述 | 发布方口径,可作为来源但不等于独立复核 |
一部 AI 长片的公开档案:15 人、14 天、11.5 万条记录
没有摄像机、没有真人演员、没有实体布景;15 人团队,14 天周期,预算 50 万美元,其中约 80% 用于算力。
- 工具链
视频和语音主要用 Seedance 2.0,整片画面由它生成;角色面部和场景资产用 Soul Cinema 做定妆照与场景参考;图片编辑用 Nano Banana Pro 和 Seedream 4.5;文字、特殊道具或场景反角度用 GPT Image 2。
视频和语音主要用 Seedance 2.0,整部 95 分钟的画面都是靠它生成的。
- 公开档案与试错
项目称留下 115,446 条生成记录,公开 108 个项目文件夹;成片采用约 960 个镜头;前 25 分钟 16,181 次生成换来 253 个最终镜头,筛选比 64:1;最难的“露露陨落”镜头重做 1,201 次。
前 25 分钟的官方数字是:16,181 次生成换来 253 个最终镜头,筛选比 64:1。
- 方法沉淀
把角色、场景、道具做成资产,用视觉资产师、表演指导、镜头导演三个技能接力,并总结出资产优先、每次都写全、一次改一处、减少自由、简化镜头五条规则。
第一,资产优先。 角色、场景和道具,先锁定,再开始生成镜头。
结果:完成《地狱苦旅》:中文整理称 95 分钟,Higgsfield 官方项目页标题称 90 分钟、完全开源,两个口径不一致。
不能据此证明:不能证明这套流程可以普遍复制,也不能说明成片质量;115,446 条、108 个文件夹、64:1、1,201 次等数字只有项目方一侧口径,没有独立复核。
基于证据重建事件顺序,非逐字对话
看起来是数量问题,其实是一个更基础的麻烦:模型不记得上一个镜头。
AI 电影最难的不是大场面,是让第二个镜头还是同一个人
真正卡住人的地方,是让观众相信前后镜头里始终是同一个人、同一个世界。这道坎有个名字:一致性。
根子在模型本身——视频模型没有跨镜头记忆。真人剧组里,同一个演员穿着同一套戏服连续拍很多镜头;AI 每生成一次,都像重新认识一次这个角色。前一个镜头还是这张脸,后一个镜头就可能换了个人。同一个角色,眼睛这次是绿色,下次变成棕色,因为模型在两次生成里各自猜了一遍。
可以把它想成:每拍一个镜头,剧组就换来一位完全不认识主角的新演员。想让每一位新演员都认得同一个角色,反复叮嘱“不要变脸”没有用,得先建立一套资产系统。
类比视频模型没有跨镜头记忆每拍一个镜头,剧组就换一位完全不认识主角的新演员。
资产系统里最基础的一张,是角色的定妆照。
给模型一张身份证:定妆照怎么让角色不再换脸
角色资产由两部分组成:一段固定的文字描述,加一组参考图。参考图通常三张——脸部特写、正面全身、背面全身。文字描述原样放进每一条提示词,参考图则给模型一个明确的视觉锚点。
选脸的标准有点反直觉:挑最“可信”的脸,不要只挑最“漂亮”的脸。一张静态看着很精致的脸,进到视频里一动就可能露馅,过度精致、塑料感强的脸尤其容易崩。反复试错还留下五个细节。正面全身图可以不放头,脸只从特写里取,这样模型取脸时只有一个明确来源。参考图一定要保留眼神光,瞳孔里少一点光,整张脸立刻就没有神采。角色表要尽量平淡,中性灰、平光、真实毛孔就够了,电影感留到镜头里做。改图一次只改一个局部,不要让整张图反复完整过模型。最后是做压力测试。
压力测试的判定标准很具体:把同一个角色放进不同姿势、不同光线里连续生成十次,十次都能认出来才算稳定。而且不能只单独测,还要把它和其他角色并排,放进真实场景和真实光线里——很多资产单独看没问题,一同框就崩。测试失败时,先回头改描述和参考图,不要先怪模型。这套标准没有公布通过率、评判者和测试总量,所以它是一套能照着执行的验收动作,还谈不上被复现过的结论。
十次生成都能认出同一个角色,才算资产通过
角色资产是否稳定到在多次生成中仍能被识别为同一个角色?
- 实验设置
- 把同一个角色放进不同姿势、不同光线里连续生成;不能只单独测试,还要把它和其他角色并排,放进真实场景和真实光线里,人工判定每次都能认出才算通过。
- 样本与轮次
- 每个角色连续生成十次;总样本量、测试轮数与参与人数未知。
- 模型
- Seedance 2.0、Soul Cinema、Nano Banana Pro、Seedream 4.5、GPT Image 2
- 判定指标
- 十次都能认出来才算稳定;与其他角色同框、并在真实光线场景里也不能崩。
- 对照或基线
- 无明确对照;只有一条反向条件——不能只单独测试,必须加上同框与真实场景光线测试。
结果:公开材料只给出判定标准与测试方法,没有给出通过率、失败次数或实际测试结果。
边界:评判者是谁、模型版本、样本总量与结果全部未知,无法判断这套测试是否可重复,也不能据此推断其他模型的表现。
一个角色通过验收,还不等于资产已经做完。
常规、雨后、换装各算一个资产:拆开状态比让模型记住更便宜
同一个角色,常规、雨后、换装等状态要各自注册成一个资产,不能混着用。场景也是:白天、夜晚、雨天要当成三个不同的场景资产。关键道具会按拿法和状态拆成几个版本——握拳的镜头里就不直接露出完整水晶,只让蓝光从指缝透出来。
思路很直白:让模型一次记住所有变化,成本高而且容易失败;把状态提前拆开、分别注册,通常更便宜。代价是资产数量会膨胀,引用和检索都变复杂。公开档案里没有说明,这套资产表在 11.5 万次生成中究竟有多难维护。
15 秒镜头,1.6 万个字符:提示词为什么像一份工程文档
提示词会长到不像话。一条 15 秒镜头的提示词,中位数约 1.6 万个字符,最长的一条接近 4 万个,体量接近一篇长文。原因仍然是模型没有记忆:角色当前是什么状态、站在哪里、穿什么、怎么动,每换一个镜头都得重新写一遍。
但长不是目的。这些提示词有固定结构,被分成 15 个模块。前五个管场景与画面:场景设定、活跃参考、空间地图、第一帧与站位、格式模式。中间五个管拍摄与运动:光学、摄像机、动作时间线、物理、灯光。最后五个管声音、表演与约束:音频、角色表演、风格、质量、正向约束。
三个地方最容易出错。每张参考图都要写清用途,否则模型会自己决定:你想让它参考脸,它可能照搬构图。台词必须单独锁定,只说引号里的内容,因为模型喜欢临场加词。人数和道具数量要写成“严格几个角色”,不限制它就可能多出一个人,甚至把家具复制一份。
措辞上还有几条硬规则。每个动作节拍最多三句话,节拍塞太满,模型就会含糊处理。动作尽量用肯定句:写“身体正面落地”,不写“不要背部落地”,因为“不”字可能被忽略。需要出场的角色最好第一帧就在画面里,除剧情要求不要让角色直视镜头。尽量不要直接写年龄,改用身份、服装和动作表达。再维护一份禁用词字典,比如把 dark 换成 low key,把 jolting 换成 rapid motion。
最后是一份固定风格前缀:8K IMAX、自然逆光、色彩比例、180 度快门、真实皮肤、每秒 24 帧。它会原样复制到每条提示词末尾,像整部电影共用的一份视觉配方。
规则这么多,每次从头手写并不现实,于是流程被拆成三个技能。
三个技能接力:定样貌、定行为、定拍法
整片画面主要由 Seedance 2.0 生成。围绕它,三个技能组成一条镜头生产线。视觉资产师先把人、场景和道具准备清楚;表演指导规定人物在这场戏里具体怎么演;镜头导演把资产、表演和拍摄要求组装成最终的视频提示词。一句话记法:资产师定样貌,表演指导定行为,镜头导演定拍法。
视觉资产师接的是角色设定、场景需求、道具,或者一张待修改的现有图片。它先判断该用哪个图像模型,再给出可以直接使用的生成或编辑提示词、界面里要设置的参数和生成注意事项。它交付的未必是一张成品图,有时就是一套执行方案:该用哪个模型、提示词怎么写、界面里要设置哪些参数、生成时注意什么。改图时它坚持一次只改一件事:比如只调表面的痕迹,就把脸、服装、机位、光线和背景全部锁住。它主要防三类问题:模型选错、风格跑偏,以及改一个局部却把整张图改坏。
表演指导处理的是“AI 角色像木偶、只会念台词”的问题。它的核心判断是:情绪本身拍不出来,能拍出来的只有人在压力下做出的行为。所以它不写“他很愤怒”,写的是镜头拍得到的动作——下颌咬紧、停顿半秒、视线移开、手指收紧、声音压低——再安排一场戏里出现两到四次看得见的节拍变化。交付物是角色行为档案、声音锚点和可直接使用的表演段落。
镜头导演只负责当前这一条镜头,不负责写完整部电影。它补齐首帧:谁站在哪里、人物看向谁、摄影机在哪一侧。再把动作按秒排好,写清物体重量、光线方向和台词时刻。交付前它检查首帧空白、左右互换、视线反转、动作漂浮,以及上一条提示词的内容误带进来,最后给出一份可以直接送进视频模型的英文成品指令。
三技能流水线:每一步的输出就是下一步的输入
视觉资产师
接收导演任务单,锁定角色、场景和道具,交付资产包和“什么不能变”的清单。
表演指导
把情绪翻译成逐秒动作、呼吸和声音锚点,不碰机位和灯光。
镜头导演
把资产包与表演节拍组装成成品指令,补齐首帧、时间线、灯光、物理和声音。
送进视频模型
整片画面主要由 Seedance 2.0 生成,得到视频候选。
按错误层级退回
换脸与漂移退回资产师,木偶化退回表演指导,站位与机位错误退回镜头导演。
前一步的输出就是后一步的输入,这也是失败之后还能找到退路的原因。
同一个镜头跑一遍:罗科看照片的 15 秒怎么被拆开
《地狱苦旅》里的“罗科看照片”是一个 15 秒、两个连续镜头的段落:罗科独自坐在旧黄冰箱旁边,看着露露的拍立得照片,一开始拼命忍住,最后还是彻底失控。
交给视频模型之前有三道关。罗科不能换脸,雨后发丝、黑色背心、旧黄冰箱和冷蓝色逆光都要一致。不能只写“他很悲伤”,悲伤得变成肌肉、呼吸和身体动作。15 秒里要完成两个连续镜头,人物、照片、光线和动作不能在切换时跳掉。
第一棒,视觉资产师判断这次不需要重新设计罗科,沿用他的雨后状态,锁住脸部比例、发丝长度、黑色背心、旧黄冰箱、照片大小和冷蓝色逆光,允许变化的只有泪水、嘴唇、下颌、肩膀和身体姿态。第二棒,表演指导把悲伤拆成四段看得见的节拍:从低眼、浅呼吸,到一滴泪滑下、咬肌收紧、嘴唇颤动,再到抿嘴失败、嘴角塌落、呜咽挤出喉咙,最后埋头蜷缩、肩膀随抽泣颤抖。第三棒,镜头导演把两份材料组装起来。第一镜用侧面特写,拍脸从克制走向失守;第二镜切侧面中景,拍身体蜷缩。两个镜头必须共享同一空间和同一种光线,首帧不能空白,也不能换脸、漂浮,或者多出一个人。
这个案例能说明的是这条生产线怎样交接。它证明不了全片每条镜头都达到同样效果——这是项目自己挑出来的例子,没有独立评审,也没有对照。
罗科看照片:15 秒里跑完三棒接力
罗科独自坐在旧黄冰箱旁边看着露露的拍立得照片,一开始拼命忍住,最后还是彻底失控;15 秒内要完成两个连续镜头。
- 视觉资产师锁定资产
沿用罗科的雨后状态,锁定脸部比例、雨后发丝、黑色背心、旧黄冰箱、照片大小和冷蓝色逆光。允许变化的只有泪水、嘴唇、下颌、肩膀和身体姿态;交付角色、场景、道具参考及锁定清单。
允许变化的,只有泪水、嘴唇、下颌、肩膀和身体姿态。
- 表演指导拆解表演
把悲伤拆成四段:0-3 秒低眼看着画外照片、呼吸很浅;3-6 秒一滴泪滑下、咬肌收紧、嘴唇颤动;6-10 秒抿嘴失败、嘴角塌落、呜咽挤出喉咙;10-15 秒埋头膝盖、身体蜷缩、肩膀随抽泣颤抖。
0-3 秒:他低着眼,看着画外的照片。呼吸很浅,身体几乎不动。
- 镜头导演总装
第一镜用侧面特写拍面部从克制走向失守;第二镜切侧面中景拍身体蜷缩;补充旧黄冰箱、冷蓝逆光、雨后发丝、黑色背心和照片不能变,两镜保持同一空间和光线,首帧不能空白、不能换脸、漂浮或多出一个人。
两个镜头必须保持同一个空间、同一种光线;首帧不能空白,也不能换脸、漂浮,或者多出一个人。
结果:三项技能接力后交付成品指令与视频候选。
不能据此证明:这是项目自选的单个案例,没有独立评审或视频验证,不能说明其他镜头或整片都达到同样稳定性。
基于证据重建事件顺序,非逐字对话
即使三棒都跑对,镜头还是会被打回很多次。那么一条废片出来,该退回哪一棒?
废片不是白拍的:先判断它错在哪一层
一条废片出来,先判断它错在哪一层,比继续往提示词里加字有用。
罗科换脸了,服装变了,房间或者道具漂移了——退回视觉资产师:换参考图、补锁定项,或者把角色状态拆得更细。人物像木偶,情绪突然跳出来,没有逐步变化——退回表演指导:重新安排动作、停顿、呼吸和反应节拍。错的是站位、机位、视线或者动作顺序——退回镜头导演:把镜头简化,把时间线重新排清楚,再锁定空间关系。
三个技能真正的用法就在这里:先生成,再诊断,然后把问题退回正确的层级。围着同一句措辞反复打转,通常解决不了问题。它不保证第一遍成功——公开档案里,即使是最顺利的前 25 分钟,也要用 64 条废片换 1 条可用片;最难的“露露陨落”镜头重做了 1,201 次。它的价值在于,做到第二遍、第二十遍,甚至第二百遍的时候,你依然知道自己到底在改什么。
镜头不合格时,先判断该退回哪一层
- 条件角色换脸、服装变化、房间或道具漂移结果问题出在资产层可以怎么做退回视觉资产师:换参考图、补锁定项,或把角色状态拆得更细
- 条件人物像木偶、情绪突然跳出来、缺少逐步变化结果问题出在表演层可以怎么做退回表演指导:重新安排动作、停顿、呼吸和反应节拍
- 条件站位、机位、视线或动作顺序出错结果问题出在镜头层可以怎么做退回镜头导演:简化镜头、重排时间线、锁定空间关系
把整套方法压到最短,是五条规则;但这份档案也留下了它没说清的部分。
五条规则,和这份档案没有回答的问题
第一,资产优先:角色、场景和道具先锁定,再开始生成镜头。第二,每次都写全:固定描述原样写进每一条提示词,不要指望模型记得。第三,一次改一处:整段重写往往会把原本有效的部分一起丢掉,改一个变量看一次结果。
第四,减少自由:空间要有角落,动作要有锚点,一个镜头尽量只完成一个核心动作。第五,简化镜头:一个复杂镜头做不出来,就把它拆成两个。有些失败是因为要求得太多,换措辞救不回来。
这五条并不只对电影有用。项目方的说法是,只要规则被认真执行,这条生产线可以缩小到一个人的团队;不过公开材料里没有个人团队的实际执行案例或数据,这仍是一句方法论层面的判断。
档案没有回答的问题同样清楚。片长到底是 90 分钟还是 95 分钟,两个口径并存。50 万美元预算和约 80% 的算力占比没有细目。11.5 万条生成记录、108 个项目文件夹、64:1、1,201 次这些数字都来自项目方口径,以及一份对档案的中文整理,没有独立第三方复核。15 人团队的具体分工、14 天是否包含前期与后期,也没有说明。成片质量、观众反馈和商业表现,材料里都没有。公开档案能证明的是做法可以被完整记录,不等于结果已经被独立验证。
回到最开始那个问题:没有摄像机,怎么拍出一部电影?答案是一套把一致性拆成工序的流程——先把人和世界做成可复用的资产,再把每个镜头写成不能省字的工程文档,出错时按层退回重做。AI 不会记住你;它需要知道的一切,都得一次一次重新写进去。



