“语音生成视频”通常指什么?
大多数语音转视频工具要求先上传旁白,等待系统分析,再输出由素材、字幕、数字人或生成短片组成的成片。这适合把播客和语音笔记改造成社交视频,但语音只是未来导出的原材料。
AIR Live 的不同之处是:语音是一套实时控制界面。你在生成画面已经播放时继续说话,同一个场景的下一部分会随之改变。
实时语音导演如何工作?
- 点击麦克风按钮,浏览器请求权限并开始聆听。
- 浏览器语音识别把开场描述转成文字。
- Evolink 把完整句子整理成画面指令;整理服务不可用时保留原话。
- 账号积分充足时,第一句指令启动付费的 fal H3 Max Director 会话。
- 后续说出的指令通过同一条连接改变场景。
- 生成的视频与音频通过 WebRTC 返回。停止后,录制的视频上传云存储并保存到账号。
例如,“等一下,保持同一个女人,镜头移到她背后,然后让整座城市停电”,会被整理为保留人物、摄影机要求和视觉事件的简洁指令,同时去掉口头语。
为什么不只用浏览器转写?
浏览器语音识别能输出文字,但一句话可能带着犹豫、口头语或临时纠正。Evolink 结合当前场景,把句子整理成可执行的导演指令,它并不负责传输麦克风音频。Gemini Live 是另一条可选的流式语音链路,不是浏览器转写的前置条件。浏览器不支持语音识别时,仍然可以输入文字。
隐私边界
AIR Live 不会主动保存原始麦克风音频。浏览器把音频流式传给已配置的语音服务进行实时处理;最终场景指令可能随生成记录保存。你可以随时停止聆听,也可以完全使用文字导演。
开始用声音导演世界
打开 AIR Live,点击麦克风按钮,说出你的开场。实时模式 60 秒需要 72 积分,文字生成的 5 秒预览需要 4 积分。