AI视频创作深度经验:提示词、画布与Agent模式的一致性突破法则
Seedance 2.0 已经上手一段时间,大家玩出了很多花样,但仍有几个难题困扰着行业:人物、风格、场景的一致性,以及人物空间位置和镜头位置的精确控制。工作流设计不当,前后两段15秒视频之间就容易断裂,只能反复抽卡,尤其在AI短剧领域,由此带来的成本压力不小。
最近看了海辛和阿文的一些分享,有几个心得非常值得沉淀。
1)提示词的关键不在华丽,在于明确主体、场景、音效与镜头信息。
- 主体:直接指定参考图,用一个固定名称贯穿整个剧本;
- 场景:一张场景参考图足矣;
- 音乐:务必注明“不要生成任何背景音乐,只生成环境音效”,否则后期剪辑会非常头疼;
- 镜头:时间戳按需添加,但镜号必须清晰,比如镜头01、02,便于前后衔接。
提示词的结构可以参照海辛提供的成熟模板。

2)不要盲目追求分辨率。目前 720P 对提示词的遵循度最高,1080P 次之,4K 反而容易失控。
3)核心仍然是画面控制。动手前,脑中要先有清晰的分镜、画面、转场、动作、运镜和剧情细节。好的画面是讲好故事的前提。
4)你自己都不看的提示词,也别指望 AI 能生成高质量视频。
这些经验,有些可以交给工具,有些必须自己把关。像提示词结构、主体和场景的复用工作,完全可以交给 Agent 自动化;但具体的画面感、分镜节奏和情感走向,还是要创作者自己拿捏。
最近一些 AI 视频工具进一步强化了创作手感,比如内置画布模式和 Agent 加速模式,让精细控制与效率不再对立。下面以一次完整的短片制作过程,体验一下这种“双模”驱动。
实践技巧:画布与Agent双模式协作
1)画布模式:手搓细节的分镜规划
设想一个科幻短片,故事设定如下:
女孩小夏醒来后突然失语,却意外发现自己可以用意念操控身边百米内的物体。她从床上起身、出门,由此展开一场奇幻之旅。
任务:基于此设定,构思一段 90 秒的 AI 短片脚本,分为 6 段 15 秒视频,逐段设计视频提示词。
要求: 1、故事逻辑严谨,硬核科幻内核,开放性结局,引人深思。 2、共设计 6 段 15 秒视频提示词。
先新建一个空白画布。

在画布中双击即可自由创建文本、图片、视频和分镜表节点。工具会自动输出一份含提示词的脚本。

接着继续向它输入指令:
请基于这个脚本,设计出需要用到的角色和场景的文生图提示词。
然后就能用这些提示词生成人物、道具和场景图了。

在图像生成方面,主流的平台支持多种模型,比如香蕉2、 Seedream 5.0、MJ V7 和 Image2。实测下来,建议优先选择 Image2。

这里分享一个我常用的人物主体提示词:
约20岁东亚少女,齐肩微乱黑发,杏眼,鹅蛋脸,浅灰白棉质睡裙,3/4 视角半身清晰,电影级硬科幻写实,干净浅灰纯色背景只展示主体,8K,精致细节,studio 柔光。
这是穿睡衣的小夏。略作调整,就能得到出门装扮的版本。

人物、场景等资产准备就绪后,就可以按照先前设计的镜头提示词来生成视频。

视频提示词严格遵循前面提到的规范:
- 开头就锁定主体人物、场景和音效要求;
- 写明“不要生成任何背景音乐,只生成环境音效”;
- 清楚标注镜号和镜号内容,时间戳酌情添加;
- 每个镜号内,详细描述场景、景别、人物动作、台词、打光和转场等。
最重要的一条:提示词是用来描述画面内容的,而不是渲染情绪或堆砌无关形容。

另外,如果对某个细节不清楚,宁可留白交给 AI 自行推理,不要生造运镜、景别和光源参数,否则极易导致画面冲突,生成不合格的视频。
我用这套方法生成了六段 15 秒视频,基本都是一次通过。最后放入剪辑软件,删减废镜、配上背景音乐,一支 AI 短片《The Silent Radius》就诞生了。
下方是缩略图展示的视频画面效果。

2)Agent模式:一键式脚本拆解与批量生成
Agent 模式则简单很多,核心在于先写好一份结构完整的剧本,然后上传。

开始生成前,可以先配置 Agent 的参数。

这些选项看起来多,实质就是指定:用哪个模型做文生文、用哪个做文生图和文生视频,以及输出尺寸和风格。
上传剧本后,Agent 会自动分析故事情节和转折点,把剧本拆分为更完整的叙事单元。

同时,角色、场景、道具等的资产图提示词,以及每一小节的视频制作提示词,都会被自动设计出来,并且支持批量生成。

有了资产图,便可进入视频生成阶段。Agent 会根据你的配置,自动添加参考图、提示词并匹配各片段的时长。

这里有一个很值得称道的设计:它生成的不同片段之间一致性极高,人物不会突然变脸,场景与机位也保持稳定。原因在于,它并非每 15 秒独立生成视频,而是先基于整集剧本生成一段预览视频,把人物造型、空间关系和镜头关系先行锚定,再从中提取关键帧,作为后续每个片段的分镜参考。

这样,后面生成的所有片段都围绕同一套“参考答案”,整个短剧的人物、场景和镜头衔接都会非常平滑,也能有效降低抽卡次数。
所有片段生成后,它们会被自动汇总到剪辑台,直接导出成片。
下面是该方式生成的成片效果缩略图。

整个过程几乎不用动脑,只需要持续点击、确认,效率非常高。
Agent 模式下生成的所有叙事单元,都可以一键切换到画布模式。

导入画布后,Agent 生成的全部内容都会变成可编辑节点,方便你自由调整或进一步细化。

Agent 与画布的结合,让 AI 视频从“一键生成”变成了一套可以反复推敲、持续精细打磨的创作系统:既保留了画布的自由,也解决了纯画布上手慢、搭建成本高的问题。
3)3D片场:把脑中分镜预先可视化的利器
前文提到,视频生成前,脑中最好有具体的分镜、画面和转场细节。而一些工具提供的“3D片场”功能,正好可以把这些脑海中的镜头具象化。
用 2D 资产做视频时,经常会碰到人物空间关系错乱、镜头位置不可控、片段不连贯的痛点。借助 3D 片场,可以把 2D 场景一键转化为可漫游的 3D 影棚。把人物白模放进影棚,你就能像导演那样自由调度机位和视角,提前敲定人物与场景的位置关系。
定好关系后,再将白模替换成你生成的角色资产,截图即可作为后续视频的分镜参考图,随心所欲地控制场景关系和镜头角度。
操作很简单,在“资产生成 - 场景”中选择场景图。

点击“生成3D片场”,完成后即可进入片场。

在 3D 片场里,可以 360 度旋转视角、调整机位和俯仰角,并添加人物白模。以下是一个快速录屏演示的效果。

定好角度后,点击“截取画面”,当前视角的分镜图就会被存入资产。接下来进行效果增强,用角色做参考图,你的人物就能自由出现在片场中的任何位置。


最后
最近看到一个有意思的观点:曾几何时,人工需要 30 天才能做出如今 AI 的水准;而现在,人加 AI 同样需要 30 天,才能做出大家满意的作品。工具门槛在降低,但受众的审美标准也在同步提升。
AI 视频领域亦是如此,早已从“生成时代”进入“创作时代”。单纯堆量无法满足观众,真正打动市场的,始终是那些被精心打磨的作品。技术迭代,观众审美水涨船高,对创作者的要求也愈发严格。
一套优秀的创作工具,应当围绕创作流程而设计:想要手搓细节,有自由画布供你雕琢;追求效率,Agent 能帮你快速起稿。它不替你做决定,只是把反复试错的过程总结好,让你少抽很多卡。
随着 Seedance 2.5 即将发布,这些能力还会被第一时间接入,届时创作的流畅度和一致性有望再上一个台阶。对 AI 视频创作有兴趣的朋友,不妨多多尝试,在实践中找到最适合自己的那套流程。