AIGC 视频:两段 AI 短片
这是我今年一直在关注和动手的方向。下面两段 15 秒的短片都是我做的:提示词是我写的, 分镜和参数也是我定的,画面和声音由 MiniMax H3 一起生成,跑在租来的云端显卡上。
这两段片子是什么
两段都是 15 秒、24 帧,各带自己的声音。第一段跟着一位女武士穿过紫色霓虹都市: 镜头从她的靴子和插在地上的刀开始,上移到眼睛,最后拉远,背后是一轮满月—— 一串快速切换的镜头,像动画片的片头。第二段更像一张会动的海报,黑红两色: 镰刀扫过画面,血月亮起,最后一秒她落座在王座上。
两段之间没有共同的角色和故事,共同的是做法:我先写一段描述,模型把它变成会动的画面。 两段都是第一次跑出来就能用,没有重跑。
用的是什么
下面这些数字是从片子文件里读出来的,文件里带着生成时的完整记录。 用大白话说,它们记录的就是:我让哪个模型、用多少步、出多长的片子。
| 生成模型 | MiniMax H3,一个能同时出画面和声音的视频模型,所以音效和配乐是同一轮生成出来的 |
|---|---|
| 用的工具 | ComfyUI:一个把各个步骤用方框连起来搭流程的程序 |
| 模型文件 | H3 的模型文件(压缩成 int8 的版本,省显存),加上音频和视频两个解码器(VAE) |
| 加速 | 同门的 turbo LoRA:把采样压到 8 步,出片快一些,细节会稍微让一点 |
| 采样 | euler 采样器 + beta 调度,8 步;随机种固定,两段用的是同一套 |
| 时长与帧率 | 15 秒、每秒 24 帧,一共 358 帧 |
| 成片尺寸 | 第一段出的是 1024×576;第二段用的尺寸更小,736×416 |
| 跑在哪 | 这台树莓派跑不动这种模型,算力是租来的云端显卡,不用的时候就关掉 |
| 提示词 | 每段几百字,是我写的:风格、角色、分镜、运镜和配色关键词都写在里面 |
提示词是怎么写的
给 AI 写视频提示词不像写一句话,更像写分镜脚本。第一段我就是这么写的: 先定整体风格(日系赛博朋克 PV 动画、高燃、冷紫色调),再写角色(黑色高马尾、紫色眼眸、 带金色樱花纹饰的和风长袍、白缠绳的武士刀),然后一个镜头一个镜头往下写—— 先靴子和插在地上的刀,再眼睛特写,再拔刀挥刀,最后拉远收尾—— 最后单独列一行"镜头语言",一行"色彩关键词",一行"风格关键词"。
有意思的是另一半:连"声音该怎么响"也要写进去。第二段的描述里就写了屋顶上的脚步声、 镰刀划过空气的呼啸、落座时的那记鼓点,还专门要求音乐在挥刀那一瞬间完全停一下。
下面这句是从第二段文件里那份提示词原文里摘的(翻译成中文)。整段有好几百字,这只是其中一句。
“【镜头 1】广角低角度,画面中是少女穿过屋顶朝镜头走来的黑色剪影, 巨大的深红色月盘挂在黑天的右上方;镰刀扛在肩上,外套和头发在风里翻动,轮廓被红色的边光勾出来。”
难在哪
- 角色得前后保持一致。模型不记得你上一版的角色长什么样,所以描述里要一遍遍写清楚: 头发、眼睛、衣服、武器形状,还要专门声明"全程保持同一造型"。
- 切镜头的时刻要自己标。一次生成里包含好几个镜头,所以得在描述里写清"第 2.5 秒切到……""第 11 秒……", 不标清楚,镜头就会拖或者乱切。
- 要求得一次写全。租显卡按小时算钱,所以每跑一次都得能用,写的时候就不能留"跑坏了再补"的余地。 这两段正好都是一次跑出来的。
时间与成本
- ¥2.5 / 小时云端显卡的价钱
- 2 小时一共开机的时间
- ¥5两段片子加起来
- 各一版第一次就跑对了
| 用什么跑 | 租的云端显卡,每小时 2.5 元;这台树莓派跑不动这种模型 |
|---|---|
| 时间 | 一共租了 2 小时,两段 15 秒的片子都在这段时间里跑完 |
| 花的钱 | 2 小时 × 2.5 元 = 5 元 |
| 试了几版 | 各一版,没有重跑:页面上这两段就是第一次跑出来的,没有额外花钱再试 |
钱是我自己记的账:2 小时 × 2.5 元,是个约数。两段都一次跑成,所以没有多花时间去重跑。
想自己试的话
普通电脑跑不动。这种模型很吃显存,所以这次是租云端的显卡来跑。 租显卡按小时算钱,所以最好先把提示词写好、把参数想清楚,再开机。
认真拿去用之前,先看许可条款。各家模型对生成内容的用途规定不一样,条款也会改, 用之前去模型自己的页面上看一眼。
云端平台会审核提示词。你写的内容由平台先过一遍,在自己电脑上没问题的描述, 放到云上有可能会被拦下来。
备注:表格里的参数是 2026 年 9 月 23 日从这两段片子的文件里读出来的(文件里带着生成时的完整记录); 网页上这两段是压缩过的版本,尺寸按压缩后算。