语音生成视频 AI:在画面播放时直接导演

AIR Live 把说出的导演意图实时变成连续生成视频中的下一幕,而不是上传录音后等待剪辑成片。
2026/09/04

“语音生成视频”通常指什么?

大多数语音转视频工具要求先上传旁白,等待系统分析,再输出由素材、字幕、数字人或生成短片组成的成片。这适合把播客和语音笔记改造成社交视频,但语音只是未来导出的原材料。

AIR Live 的不同之处是:语音是一套实时控制界面。你在生成画面已经播放时继续说话,同一个场景的下一部分会随之改变。

实时语音导演如何工作?

  1. 点击麦克风按钮,浏览器请求权限并开始聆听。
  2. 浏览器语音识别把开场描述转成文字。
  3. Evolink 把完整句子整理成画面指令;整理服务不可用时保留原话。
  4. 账号积分充足时,第一句指令启动付费的 fal H3 Max Director 会话。
  5. 后续说出的指令通过同一条连接改变场景。
  6. 生成的视频与音频通过 WebRTC 返回。停止后,录制的视频上传云存储并保存到账号。

例如,“等一下,保持同一个女人,镜头移到她背后,然后让整座城市停电”,会被整理为保留人物、摄影机要求和视觉事件的简洁指令,同时去掉口头语。

为什么不只用浏览器转写?

浏览器语音识别能输出文字,但一句话可能带着犹豫、口头语或临时纠正。Evolink 结合当前场景,把句子整理成可执行的导演指令,它并不负责传输麦克风音频。Gemini Live 是另一条可选的流式语音链路,不是浏览器转写的前置条件。浏览器不支持语音识别时,仍然可以输入文字。

隐私边界

AIR Live 不会主动保存原始麦克风音频。浏览器把音频流式传给已配置的语音服务进行实时处理;最终场景指令可能随生成记录保存。你可以随时停止聆听,也可以完全使用文字导演。

开始用声音导演世界

打开 AIR Live,点击麦克风按钮,说出你的开场。实时模式 60 秒需要 72 积分,文字生成的 5 秒预览需要 4 积分。

在画面播放时使用语音生成视频

这里的语音生成视频是什么意思?

这里的语音生成视频把说话当作导演方式,不是先上传旁白文件再等待剪辑。Live 中的语音生成视频允许你在当前画面播放时要求下一步动作,结束以后留下录像,而不是只保留一段聊天文字。

语音生成视频可以从简单事件开始:一个人推门、一列车到站,或者光线扫过房间。给语音生成视频开场留出继续决定的空间,比同时列出很多无关的视觉情绪更容易发展成一段连贯、能够判断的场景。

语音生成视频先选对识别语言

开始语音生成视频之前,确认麦克风旁的识别语言。语音生成视频不应因为浏览器偏好中文,就悄悄改变英文页面的默认设置。页面决定初始语言,你也可以明确选择另一种语言来识别。

语音生成视频更需要安静环境和清楚句子,而不是大声喊。每条完整要求之后留一点停顿;名字反复听错时,用外观描述人物,或者在生成短片之前直接修改已经识别出的文字。

给语音生成视频可见的动作

告诉语音生成视频摄影机能拍到什么。“她转向打开的窗户”比一段人物传记更具体。交给语音生成视频的描述应包含主体、变化以及必须保留的关系,而不是单纯堆积很多形容词。

语音生成视频的修正可以很短,例如保持同一个女人、把镜头移到背后。每次从头复述整个房间,反而不利于保留已经有效的部分。一次具体改变,能够给接下来的画面更清楚的目的。

语音生成视频分开显示转写与指令

尚未说完的句子可能继续修正,语音生成视频会把转写与提交的方向分开。Evolink 帮助语音生成视频整理完整文字、减少口头语,但它不负责浏览器里的原始麦克风音频传输。

短片模式的语音生成视频先填写可编辑描述。整理尚未完成就关麦克风,也会保留已听到的内容,不会自动提交短片。真正的生成操作及其积分要求,与口述准备场景是分开的。

语音生成视频为什么有响应等待?

语音生成视频包括识别、整理、模型生成和播放。语音生成视频不能替换已经看过的帧,缓冲内容也可能先于新要求出现。判断响应应看相关动作何时体现,不是只盯着一个状态标签。

语音生成视频连接尚未完成时,后续完整指令属于同一次启动,会暂存并在就绪后发送。取消启动会清除这些内容,不应该在你已经停止或者换了模式以后,又突然补发给视频模型。

语音生成视频要有明确失败反馈

语音生成视频需要区分权限被拒、网络失败和没有检测到说话。语音生成视频按钮换了颜色,并不能证明系统听懂了内容。检查实际转写,文字仍为空时,应当看到具体原因而不是一直等待。

语音生成视频不能识别声音时,仍可以输入文字,不必反复开启付费会话来排查麦克风。短片模式允许独立准备描述;视频引擎未开放时,真正会消耗积分的生成动作仍保持拦截。

保留语音生成视频的作品

有用的语音生成视频应该在对话结束后留下文件。AIR Live 录制模型画面与声音,再把录像上传账号。语音生成视频中的麦克风是控制输入,不会自动作为你的旁白混入完成的录像。

语音生成视频显示保存完成以前,先不要关掉页面。语音生成视频上传失败应当恢复已有素材,而不是要求重新生成。保存后不带新指令回放一次,下载值得保留的片段,再进入后续筛选和剪辑。

什么任务适合语音生成视频?

当口头修改比重写场景更快时,语音生成视频才有直接价值,例如试运镜、探索视觉想法或安排粗略情节。如果任务从开始就要求精确字样和固定剪辑,语音生成视频不一定是最合适的第一步。

第一次语音生成视频可只选一个主体和两次计划中的变化。回看时判断说话是否帮助了决定、主体是否稳定、素材是否值得使用,用这些结果判断语音生成视频,比只统计接受了多少条指令,更接近真正的创作效果。