成片拆解用深度+脸部网点视频驱动 MiniMax H3,复刻抖音手势舞:女仆装女孩逐帧跟动作。
结构:固定机位 · 手势舞逐帧复刻 · 挥手收尾
看完成片再对照:这条片子靠什么在几秒内抓住人。点时间可跳到成片对应位置。
第 0 秒女仆装黑长直女孩就把手掌推向镜头,紧接着用双手比出取景框——一开场就是爆款手势。
约 1–5s 双手一上一下比出取景框,停在胸前,节奏和停顿都跟参考视频一致。
约 6–10s 换成托腮、手指点下巴的可爱动作,头部随之轻轻歪动。
约 11–15s 双手在胸前交叉摆动,再向画面两侧挥手,最后放下手看镜头。
把真人舞蹈转成深度+脸部网点视频当 <Video 1>,提示词反复强调按原时间顺序逐帧复刻、不跳帧不加速,并声明只借动作不借可视化外观。
别急着上视频模型。这个片子的秘密是:先把角色和场景锁死,再一次生成 1 个镜头。
576×1024 · 15.65 秒 · 9:16。作者在自回复里连同提示词一起公开了这段驱动视频:把一段抖音手势舞转成黑白深度图,再叠上脸部网点/连线。它只负责身体动作、头部姿态和节奏,不是最终画面。作者没有说明深度和脸部网点是用什么工具做的。
提示词里的 <Picture 2> 是决定最终人物外观的彩色写实参考图,作者没有公开这张图。模型是 MiniMax H3(作者回复「我用 Mini Max H3」),作者还推荐了 Hugging Face 上的 Minimax-h3_Singularity 版本。成片为 1440×2560、30fps、15.65 秒竖屏。
把下方中文提示词整段粘贴,<Video 1> 对应深度视频、<Picture 2> 对应人物图。提示词分三块:按参考视频逐帧复刻动作与停顿;只借动作、不复制面部可视化标记;输出保持 <Picture 2> 的彩色写实外观,不出现灰色深度、点线、网格、字幕或新增镜头。
方便你对照成片理解每一镜在干什么。
直接全选复制到 Seedance。@Image 1–0 必须对应上面 REF 编号。
作者回复中文完整提示词 · MiniMax H3 · <Video 1> 深度视频 + <Picture 2> 人物图
<Video 1> 是本次片段的深度动作参考。以它的原始时间顺序和节奏为准,复刻身体、头部、手臂、手掌及手指的运动;完整保留动作幅度很小的阶段和停顿,不省略、压缩、加速或提前进入后续动作。动作的发生时刻与持续时间由参考视频决定,不另编舞。 严格按参考视频每一帧的先后顺序,在对应的时间复现其姿态和连续变化;即使相邻帧动作很小或姿态基本不变,也完整保留这一阶段的持续时间,不跳帧概括动作、不提前执行后面的动作、不重新排列动作、不自行增加动作或加快节奏。 <Video 1>仅控制身体动作、头部姿态和动作节奏,不复制其中的可视化标记作为面部外观。 参考视频只用于身体动作、头部姿态和动作节奏控制,不是最终画面内容。输出保持<Picture 2>的正常彩色写实外观,不出现灰色深度、点线、网格、字幕或新增镜头。
当前是单页静态站:视频 + 指引 + 可复制提示词。后面可以做成多教程列表、账号、收藏提示词、一键复制、手机竖屏版等。