
- 参考视频提供创作上下文,但自有素材仍须实际包含配音描述的动作和产品。
- 快捷模式侧重引导式脚本与标题流程;专业模式提供配音来源和画面合成设置。
- 自备配音会在同一批任务中共用,生成多个文件不代表形成了多个不同的表达方案。
- 验收时分别检查脚本含义、标题位置、画面匹配、声音和字幕。
参考驱动的混剪具体做什么
AI 二创混剪将参考视频、原始素材池和配音方案组合起来,生成多个视频变体。它的实际价值是提供一组可对照创作要求审核的候选视频。即使任务完成,成片也可能展示错误的产品、夸大某项好处,或者采用无法解释当前配音的镜头。
本教程依据当前桌面客户端的混剪流程,涵盖输入校验和标题审核节点,说明素材准备、配音方式选择以及效果不佳时的排查方法。后文的假设推广案例用于解释编辑决策,并非客户实际使用效果。
先根据手头素材选择入口:已有参考视频,希望用自己的素材替换并组成配音序列时,适合使用二创混剪。批量视频剪辑更适合组合预先划分的镜头组;AI 成片则从文案或参考出发,利用素材库组织可编辑工程。这些流程有交集,但准备和审核任务不同。
参考视频也会形成创作约束。导入前明确要借鉴的是主题结构、节奏、配音还是特定画面。如果只是借鉴讲解顺序,直接沿用原配音可能把不适用于自己产品的说法带入成片。应在生成前做出选择。
准备可用的参考视频与有差异的素材池
修改输出参数前,先准备数量足够、可读取且与主题相关的素材。当前入口要求至少 3 个混剪素材,素材总时长至少 1 分钟,单个素材不超过 5 分钟。这些是能否开始任务的校验条件,不能保证素材已覆盖每句配音。
- 打开 AI 二创混剪,添加一个参考视频,等待其时长加载后再继续。
- 通过客户端提供的本地文件、文件夹或素材库入口添加混剪素材。
- 检查选中文件数、总时长和单文件警告;时长未加载时,重新读取文件信息。
- 查看实际镜头,准备产品细节、使用过程和完成结果等有意义的差异,而不是多段几乎相同的录像。
流程可以对本地混剪素材进行拆分、理解并保存到素材库,已经理解过的库内素材也可复用。如果现有素材难以检索,先按素材整理与语义检索教程处理。不了解内容就继续堆积素材,往往只会增加审核负担。
区分参考与替换素材的用途。专业设置提供将参考视频画面加入混剪素材的选项,只有这些画面确实适合最终表达时才开启。参考中出现另一款产品时,不应意外让它成为自己产品功能的展示依据。
还要检查原始构图。横屏录像中的有效动作,转成竖屏后可能无法使用。应预览标签、手部等重要区域,不能只凭缩略图判断。
选择模式,并明确配音来源
希望按引导步骤处理素材、生成脚本与标题时,使用快捷模式;需要自行选择配音来源和画面合成参数时,使用专业模式。当前专业界面有四种配音方式,它们直接影响不同输出之间哪些内容可以变化。
| 配音来源 | 适用情形 | 审核重点 |
|---|---|---|
| 自动文案 | 根据参考与创作要求生成初稿。 | 无依据的说法、术语,以及开启改写后是否改变原意。 |
| 自备文案 | 措辞已经确认,需要合成配音。 | 读音、句子节奏和时序;整批使用所提供的文案。 |
| 参考视频音频 | 原有声音适合新的画面。 | 原背景音乐,以及配音是否描述了参考而非自己的素材。 |
| 上传音频 | 已有录制好的配音。 | 录音质量、转写准确性,以及素材是否覆盖全部配音。 |
自备文案可粘贴输入或上传 TXT。当前最多接受 20,000 个字符,TXT 上传限制为 100 KB。文案能够通过校验,不代表它适合预定视频时长;不要急于把长稿压缩进短视频,先删去重复表达。
上传配音当前支持 MP3、WAV、M4A、AAC、FLAC 和 OGG,时长上限 5 分钟、大小上限 100 MB。整批任务共用这段录音,据此生成字幕并匹配画面,不会另外合成替代声音。先检查录音本身,不能指望重新匹配画面解决声音问题。
自动文案的要求应写明主题、观众和禁止出现的说法,例如:“向第一次在家使用的用户解释磨豆粗细调节。只用所提供的产品素材。不要声称声音更小或操作更快。”这样可以约束理解范围,而非要求系统编造证据。
选择参考音频时,它已有的音乐仍会保留。再添加背景音乐可能导致两套音乐重叠,因此应先听参考,再决定音乐设置。
围绕表达内容设置构图与时长
输出设置应保留完整配音和重要画面信息。目标时长只是流程时序规则内的要求,不能据此删掉已确认配音的一部分。
当前时长输入范围为 3 至 300 秒;留空时,会按所选模式沿用参考时长或完整自备配音时长。界面说明配音最多可加速至 1.5 倍,必要时成片会延长以保留完整内容。要求短时长却得到较长候选时,应检查文案长度,而不是反复提交同一组不兼容的输入。
专业画面设置包括 1080 × 1920 竖屏或 1920 × 1080 横屏、原画处理或轻度调色,以及硬切或 0.3 秒淡入淡出。操作步骤需要清晰分界时可选硬切;淡化转场可能更柔和,也可能降低教学动作的清楚程度。
最短镜头时长决定某个片段能够短到什么程度。片段过短,会让观众看不清配音解释的动作;较长片段可能更易理解,但也限制同一段配音中的镜头变化。应根据产品动作判断,不能套用一个通用的“最佳节奏”。
专业模式还提供匹配素材不足时随机替换的选项。它可能让流程继续完成,却增加编辑风险:看起来合适的替代镜头未必支持当前说法。重视事实与画面对应时,应关闭此选项,或把每个替代镜头都列为必查项。
验证新素材池时,先少量生成。当前数量范围为 1 至 100 个,能够输入较大数量不意味着所有候选都各有差异、都可使用。先判断所选配音与现有镜头是否具备有意义的变化空间。
生成视频前审核脚本与标题
通过脚本和标题审核节点,在错误含义进入成片前修正。快捷模式以及开启相关标题选项时,会先生成脚本和标题供审核,再继续制作视频。
打开各候选的标题编辑器,可修改标题文本、字体、字号、对齐、样式、位置和显示区间。标题初始显示在前 3 秒,但区间可以调整。标题预览同时以只读方式显示关联配音,便于核对开头标签是否与实际说话内容一致。
修改标题不会改写配音。如果声音承诺“自动清洁”,画面只展示手动刷洗,把标题改为“维护方便”并没有解决核心问题。应通过对应脚本或输入流程修正表达,再确认视频。
随后查看任务进度和逐条候选。当前流程将结果放入素材库的 AI 二创混剪成片分组。找到实际输出并完整播放;成功状态只表示处理完成,不表示通过编辑审核。
字幕需要单独检查。W3C 的字幕指南指出自动字幕需要核对准确性。对照声音检查姓名、数字和否定词,并观察新字幕是否与原有烧录字幕或开头标题相互遮挡。
原字幕处理还有独立模式与输入要求。当前界面区分遮挡、Base 和 Pro,并提示字幕处理可能单独收费。遮挡只是隐藏某个区域,不会复原背景。应检查原素材警告及实际结果,不能把三种方式当成等价选项。
假设案例:磨豆机推广视频
假设的策划示例:一个小型设备团队希望制作两条竖屏候选,解释磨豆机的粗细调节。参考视频先提出冲煮问题,再演示调整设置。团队有四段自有录像,总时长超过 1 分钟,各段均少于 5 分钟。
准备的画面包括产品特写、手转调节旋钮、咖啡粉落入容器,以及完成后的冲煮台。已确认文案为:“从适合冲煮方式的建议设置开始。调整旋钮,磨少量咖啡粉,观察结果后再准备饮品。”这只是示例稿,并非产品规格或经过测试的效果。
编辑选择专业模式、自备文案、竖屏和硬切。参考中是另一款型号,因此不加入参考画面。每个动作都应有对应镜头,所以关闭随机替换。先将目标时长留空,检查合成配音自然需要多少时间。
| 配音节点 | 计划画面 | 审核决策 |
|---|---|---|
| 选择起始设置。 | 调节刻度特写。 | 裁切隐藏关键刻度时不采用。 |
| 转动旋钮。 | 手转调节旋钮。 | 展示豆仓而非调节动作时不采用。 |
| 观察咖啡粉。 | 容器中的咖啡粉。 | 仅保留能够看清结果的素材。 |
| 准备饮品。 | 完成后的冲煮台。 | 核对画面属于同一次演示。 |
假设某条候选在“调整旋钮”时使用了漂亮的台面空镜。即使色彩、裁切都很好,团队也应拒绝这个匹配,补充更清楚的调节画面或修改要求,再按同一节点表检查后续候选。这里描述的是建议决策流程,没有声称已生成这些结果或取得推广效果。
第二条候选只有在镜头选择形成有意的替代方案时才有价值。同样措辞、几乎相同画面的两个文件,不能仅因文件名不同就算作两种创意假设。
在产生问题的环节修正
增加生成数量前,先找到问题对应的输入或决策。原样重跑,往往仍会缺少同一镜头,或遇到相同的配音时长冲突。
- 无法开始生成:检查素材数量、总时长、单段时长、可读取的文件信息及标出的配音字段。处理具体警告,而不是随意多加一个文件。
- 画面与配音无关:找出缺失动作,补充相关素材,并查看随机替换设置。增加无关素材不能解决问题。
- 成片超过目标时长:对照完整配音和要求时长。缩短经确认的稿件或允许更长时间,不能假定工具应该删掉关键信息。
- 开头标题有误:单独审核标题与配音。如果两者都不符合原素材,应修正根本说法。
- 字幕处理失败:查看所选模式的单文件错误,并在客户端检查当前时长和分辨率限制。
- 配音听不清:先确认参考音频是否自带音乐,再降低或移除新增音乐后重试。
转码和合成也影响最终文件。FFmpeg 文档区分重新编码与复制压缩码流,提醒我们导出的衍生文件不等于原录像。保留源媒体以便修正,不要持续从已经压缩的成片再加工。
候选完成后建议分三遍播放:先看含义和镜头对应,再听声音并核对字幕,最后检查构图与标题。这些是编辑检查建议,不是客户端自动校验的承诺。需要相邻工具时查看产品指南;需要进一步精修工程时,继续阅读时间线剪辑助手教程。
目标是得到能够解释选择依据的一组变体:每条视频表达预期内容,使用支持说法的画面,并满足观看格式。保存已确认要求和审核记录,让下一批从已经解决的决策开始。
常见问题
二创混剪会生成全新的画面吗?
此流程将自备或素材库画面与参考、配音进行匹配和合成。不要假定缺少的产品动作会被生成出来;应补充合适素材或修改表达。
自备配音会在不同候选中发生变化吗?
自备文案、上传音频和参考音频模式在整批中共用配音。自动文案另有改写选项。应先核对所选模式,不能把输出数量直接当作不同表达方案的数量。
任务成功的混剪为什么仍然不能用?
处理完成并不验证产品身份、说法真实性、镜头与配音对应关系或字幕准确性。确认前应逐条播放并分别检查。
本文于 2026-10-10 根据当前桌面客户端混剪入口的只读核查及所列官方资料编写,未启动客户端进行端到端测试。界面名称、限制、账号权益和费用可能变化,请以所安装客户端的校验为准。推广案例及其设置均为明确标注的假设,不声称客户效果或生成速度实测。
