实战方案
把官方提示词指南压缩成一页可执行清单:任务句式、八要素公式、主体定义、镜头分镜写法、符号规范,以及 ID 漂移/双胞胎/风格漂移等高频翻车的修法,附直接可跑的 API 示例。
Seedance 2.0 的提示词不是“文案型形容”,而是工程型指令——官方给出的心智模型是把它当成一个多模态 AI 导演:文字、图片、视频、音频会被拆成“空间层”(画面里有什么)和“时间层”(如何随时间变化)分别理解。 本文把官方提示词指南的要点压缩成一页可执行的写法清单,并附上直接可跑的 API 调用示例。
| 任务 | 用途 | 推荐句式 |
|---|---|---|
| 多模态参考 | 从素材提取主体/风格/动作/音色,生成全新视频 | 参考<图片N>中的<主体N>,生成…;参考<音频N>中的音色,生成… |
| 编辑视频 | 局部/全局修改,未提及部分默认不变 | 严格编辑<视频N>,将<原特征>修改为<新特征> |
| 延长视频 | 时间维度延续,风格与叙事保持一致 | 向前/向后延长<视频N>,生成… |
注意一个高频踩坑点:编辑/延长任务直接写“<视频N>”,不要写“参考<视频N>”——多一个“参考”会被判成参考任务。
复杂需求按这个顺序组织:
精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
先锁定“谁在干什么”,再交代“在哪、什么氛围”,然后“怎么拍”,最后用风格、画质和约束把结果收紧。
将图片1中穿红色连衣裙、戴草帽的女人定义为主体1——2~3 个稳定的静态特征即可。主体N@图片N(如 张三@图片1),强调主体和素材的绑定。每个镜头按四件事组织:运镜方式 → 主体动作与表情 → 位置/空间变化 → 音频信息。例如:
镜头1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。
镜头2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。
镜头3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。不要写精确秒数(“0–3 秒”),2.0 对精确时间支持不稳定;一个镜头里只指定一种运镜,同时推拉摇移会让画面不稳。
缓慢抬手、用力蹬地、微微低头。低头、肩膀微微颤抖、手指攥紧衣角;“紧张”→频繁看手表、手指敲击桌面、眼神闪躲。| 信息 | 符号 | 示例 |
|---|---|---|
| 音乐 | () | (背景中播放着快节奏的摇滚乐) |
| 音效 | <> | <远处传来狗叫声> |
| 台词 | {} | {你好,世界};小语种需标注语种 |
| 字幕 | 【】 | 【第一章:启程】 |
| 现象 | 修法 |
|---|---|
| 人物 ID 漂移/换脸 | 单独提供大头照;面部/妆造分图指定;精准素材前置;不用多视图 |
| 同款“双胞胎”出现 | 每个人物绑定参考图(张三对应图片1);末尾加“禁止生成同款分身”约束;单人照代替三视图 |
| 风格漂移成写实 | 提示词明确风格约束(“3D国风漫画”),或先把参考图转成目标风格再生视频 |
| 延长视频衔接跳变 | 剪辑时前段删尾 6 帧、后段删头 1 帧;续写尽量以转场切镜时刻结尾 |
| 多次续写画质劣化 | 原视频先转白模视频再续写;控制续写次数 |
| 多音字读错 | 替换为同音常用字(“螭龙山”→“吃龙山”) |
写好的提示词直接放进 prompt 字段,通过 OpenAI 兼容接口提交异步任务(提交不扣费,成功按时长计费):
curl https://zerofa.ai/v1/videos \
-H "Authorization: Bearer sk-zerofa-xxx" \
-H "Content-Type: application/json" \
-d '{
"model": "seedance-2-0-lol",
"prompt": "镜头1:街巷侧拍,男人缓慢起跑…(按上文分镜写法)",
"duration": 5,
"resolution": "720P",
"aspect_ratio": "16:9",
"enable_audio": true
}'
# → {"id":"<task-id>","status":"submitted"},随后轮询 GET /v1/videos/<task-id>需要传参考图/参考视频等原生多模态素材时,走火山方舟 /ark 原生透传,请求体与官方完全一致、高级参数全部保留。接口细节见视频生成 API 文档,模型与实时价格见Seedance 2.0、Seedance 2.0 Fast。用新版模型的写法差异见Seedance 2.5 提示词指南。
多数是人脸参考图有效性不足:人脸和全身/服装合在一张图里、人脸占比太小。解法是单独提供一张只含面部的大头照,提示词里写明“面部特征参考图片1(大头照),妆造参考图片2(全身照)”,并把需要精准参考的素材放在提示词更靠前的位置。不要用人物多视图,模型容易把不同角度识别成多个人。
在提示词末尾加明确约束:“保持无字幕”“不要生成水印”“不要生成Logo”。目前无法 100% 规避,但能显著降低概率;横屏出字幕的概率明显低于竖屏,参考素材里的无关文字建议先抹除再输入。
Seedance 2.0 对精确时间(如 0-3 秒)的支持不稳定,强行限制时长可能导致结果异常。推荐用“镜头1/镜头2/镜头3”按事件顺序组织,让模型自然分配节奏;需要精确时间轴控制建议用 Seedance 2.5。
对模型产物反复续写会叠加画质劣化。官方推荐的缓解方法是先把原视频转成白模视频(纯白 3D 模型、无色彩纹理)再作为续写输入,同时控制续写次数、优先用高清参考图。