兴趣方向 · 2026

AIGC 视频:两段 AI 短片

这是我今年一直在关注和动手的方向。下面两段 15 秒的短片都是我做的:提示词是我写的, 分镜和参数也是我定的,画面和声音由 MiniMax H3 一起生成,跑在租来的云端显卡上。

第一段:赛博朋克武士。冷紫色调、黑金纹饰,15 秒,带声音。
第二段:血月镰刀少女。黑红配色加金色细线;银色长发、红色眼睛和那把弯镰从头到尾保持同一个样子。

这两段片子是什么

两段都是 15 秒、24 帧,各带自己的声音。第一段跟着一位女武士穿过紫色霓虹都市: 镜头从她的靴子和插在地上的刀开始,上移到眼睛,最后拉远,背后是一轮满月—— 一串快速切换的镜头,像动画片的片头。第二段更像一张会动的海报,黑红两色: 镰刀扫过画面,血月亮起,最后一秒她落座在王座上。

两段之间没有共同的角色和故事,共同的是做法:我先写一段描述,模型把它变成会动的画面。 两段都是第一次跑出来就能用,没有重跑。

用的是什么

下面这些数字是从片子文件里读出来的,文件里带着生成时的完整记录。 用大白话说,它们记录的就是:我让哪个模型、用多少步、出多长的片子。

生成模型MiniMax H3,一个能同时出画面和声音的视频模型,所以音效和配乐是同一轮生成出来的
用的工具ComfyUI:一个把各个步骤用方框连起来搭流程的程序
模型文件H3 的模型文件(压缩成 int8 的版本,省显存),加上音频和视频两个解码器(VAE)
加速同门的 turbo LoRA:把采样压到 8 步,出片快一些,细节会稍微让一点
采样euler 采样器 + beta 调度,8 步;随机种固定,两段用的是同一套
时长与帧率15 秒、每秒 24 帧,一共 358 帧
成片尺寸第一段出的是 1024×576;第二段用的尺寸更小,736×416
跑在哪这台树莓派跑不动这种模型,算力是租来的云端显卡,不用的时候就关掉
提示词每段几百字,是我写的:风格、角色、分镜、运镜和配色关键词都写在里面

提示词是怎么写的

给 AI 写视频提示词不像写一句话,更像写分镜脚本。第一段我就是这么写的: 先定整体风格(日系赛博朋克 PV 动画、高燃、冷紫色调),再写角色(黑色高马尾、紫色眼眸、 带金色樱花纹饰的和风长袍、白缠绳的武士刀),然后一个镜头一个镜头往下写—— 先靴子和插在地上的刀,再眼睛特写,再拔刀挥刀,最后拉远收尾—— 最后单独列一行"镜头语言",一行"色彩关键词",一行"风格关键词"。

有意思的是另一半:连"声音该怎么响"也要写进去。第二段的描述里就写了屋顶上的脚步声、 镰刀划过空气的呼啸、落座时的那记鼓点,还专门要求音乐在挥刀那一瞬间完全停一下。

下面这句是从第二段文件里那份提示词原文里摘的(翻译成中文)。整段有好几百字,这只是其中一句。

“【镜头 1】广角低角度,画面中是少女穿过屋顶朝镜头走来的黑色剪影, 巨大的深红色月盘挂在黑天的右上方;镰刀扛在肩上,外套和头发在风里翻动,轮廓被红色的边光勾出来。”

难在哪

时间与成本

用什么跑租的云端显卡,每小时 2.5 元;这台树莓派跑不动这种模型
时间一共租了 2 小时,两段 15 秒的片子都在这段时间里跑完
花的钱2 小时 × 2.5 元 = 5 元
试了几版各一版,没有重跑:页面上这两段就是第一次跑出来的,没有额外花钱再试

钱是我自己记的账:2 小时 × 2.5 元,是个约数。两段都一次跑成,所以没有多花时间去重跑。

想自己试的话

普通电脑跑不动。这种模型很吃显存,所以这次是租云端的显卡来跑。 租显卡按小时算钱,所以最好先把提示词写好、把参数想清楚,再开机。

认真拿去用之前,先看许可条款。各家模型对生成内容的用途规定不一样,条款也会改, 用之前去模型自己的页面上看一眼。

云端平台会审核提示词。你写的内容由平台先过一遍,在自己电脑上没问题的描述, 放到云上有可能会被拦下来。

备注:表格里的参数是 2026 年 9 月 23 日从这两段片子的文件里读出来的(文件里带着生成时的完整记录); 网页上这两段是压缩过的版本,尺寸按压缩后算。