开始创作你的数字人口播视频

AI 驱动 · 全流程自动化 · 商业级品质

按场景开始

自媒体口播
短视频口播、知识分享、Vlog
营销推广
产品介绍、直播带货、广告投放
知识科普
教程讲解、课程录制、科普视频
政企宣传
企业宣传、新闻播报、培训视频

最近创作

还没有创作记录,点击上方按钮开始吧

热门模板

FFmpeg
LLM
TTS
Avatar
1
选择模板
2
数字人形象
3
文案输入
4
声音设置
5
字幕与效果
6
预览与生成
选择创作模板
点击卡片选中,可一键应用全套样式
数字人形象
点击卡片选中,再次点击取消
高级设置
文案输入
0 字
口语化
专业
幽默
激情
温柔
字数 0 字 · 预估时长 0 秒
自由创作 不套用模板
粘贴抖音/快手/B站分享文本,系统自动提取文案(含字幕转写,无需任何配置)
文案 AI 处理
音色选择
点击卡片选中, 试听音色
声音克隆 上传5-10秒干净人声样本
语音高级设置
字幕样式
背景音乐 (BGM)
画中画 / B-roll 在字幕时间段插入插播素材
视频效果
水印
片头片尾
配置汇总
一键发布设置
加载平台登录态...
开启后,视频生成完成将自动发布到选中的平台(需先在"发布设置"页登录各平台) 前往发布设置 →
流水线进度
生成结果
视频将在此处展示
标题
—
最终文案
—
文案输入
生成设置
流水线进度
生成结果
视频将在此处展示
标题
—
封面
—
最终文案
—
详细信息

          
原始文案
AI 处理
处理结果
使用提示

润色:优化表达,保留原意

仿写:语义级改写,避免查重

扩写:增加细节和案例

缩写:精简压缩,保留核心

风格转换:调整语气风格

主题生成:根据主题创作

需先在「设置 → 模型配置」配置 LLM API Key,否则使用 Mock 模板

基础设置
选择模块执行
音频产物
执行后展示
视频产物
执行后展示
执行结果
等待执行...
批量文案输入
N 条文案 × 1 组参数 = N 个视频
批量进度
0 / 0
提交后将显示每条文案的处理进度
画中画与插播视频
画中画模式(PIP):B-roll 视频以小窗口叠加在数字人画面上,数字人仍可见(适合讲解类)
整段切换模式(CUT):在指定时间段用 B-roll 替换主画面,数字人暂离(适合展示实景素材)
三种插入方式:① 点击字幕间的 + 在两段字幕之间插入;② 点击 B-roll 轨道空白处在任意位置插入;③ 点击"在播放头插入"按当前播放位置插入
快捷剪辑:裁剪头尾、调整音量、片头片尾淡入淡出,一键应用
选择任务
B-roll 素材库
点击上传视频/图片
时间轴编辑器
请先选择一个任务
选择任务后将显示字幕时间轴
1
内容与剧本
2
角色音色
3
生成设置
4
生成结果
内容与剧本
0 字
当前为「文章输入」模式:直接在下方剧本编辑器输入内容;需要提取链接、上传文档或 AI 生成时,请点击上方对应来源
剧本(可粘贴文章让 AI 改写,或直接编辑剧本)
0 字 0 个角色
角色与音色
生成设置
0.4s
0.12s
1.0x
生成结果
数字人唇形同步工作原理
1. 上传参考素材:上传一张真人正面照片,或一段嘴巴不动的真人视频(3-10秒)
2. 生成音频:系统将文案转为语音(TTS)
3. 唇形同步:LatentSync 模型根据音频驱动参考素材中的嘴唇动作
4. 输出视频:生成嘴唇会动的数字人口播视频
注册新形象
点击或拖拽上传照片/视频
支持 JPG/PNG 照片 或 MP4/MOV 视频,建议正面清晰、嘴巴不动
已注册形象
注册新音色
点击或拖拽上传音频
支持 WAV / MP3 / M4A,无背景噪音
已注册音色
场景化创作模板
每个模板预置了该场景的口播文案骨架、字幕样式、BGM、滤镜、转场、情感、语速。选择场景后填入关键词即可生成完整文案,一键应用全部样式。
预制数字人形象库
预制形象可直接选用,搭配推荐音色。点击"使用此形象"将设为默认形象(建议上传真人照片替换占位图以获最佳效果)。
预制音色库
基于 Edge TTS 的免费音色,按场景推荐。点击"使用此音色"将设为默认音色。
样式模板库(字幕/BGM/滤镜/转场)
任务列表
任务 ID 状态 创建时间 更新时间 操作
任务详情
选择上方任务查看详情
LLM 大语言模型配置
检查中
TTS 语音合成配置
检查中
ASR 语音识别配置
数字人模型配置
检查中
×
字幕样式
背景音乐 (BGM)
视频输出参数
封面设置
0 = 抖音式立即播放正片(封面仅作预览图与发布封面);>0 = 封面显示 N 秒后转场进正片
正片开始到开口说话的间隔,0.2-0.4 最自然(字幕/口型自动同步,无需担心错位)
数字人场景
音频效果
视频效果
水印
片头片尾
两套 Cookie 体系说明
平台账号登录(下方"账号管理")
用途:发布视频到抖音/快手/B站/视频号
方式:点击"登录"按钮,浏览器扫码或账密登录
存储:config/cookies/{platform}.json
技术:Playwright 自动化发布
ASR Cookie(向导步骤3"对标提取")
用途:从抖音/快手等平台提取爆款文案
方式:上传 Netscape 格式 .txt 文件
存储:config/asr_cookies.txt
技术:yt-dlp 下载后 ASR 转文字
两套 Cookie 互不复用:发布 Cookie 用于上传视频,ASR Cookie 用于下载视频提取文案。如需提取爆款文案,请在向导步骤3"对标提取"中上传 ASR Cookie。
账号管理
登录一次后永久复用,无需重复登录
使用说明:点击平台卡片的"登录"按钮,在弹出的浏览器窗口中完成登录,Cookie 会自动保存。后续发布无需再次登录。
一键发布
将视频发布到已登录的平台
⚙ 更多选项(描述、标签)
发布历史
最近 5 次发布记录
🔧 高级选项(发布模式 / 平台启用 / 手动 Cookie / 发布测试台)
发布模式
平台管理
手动 Cookie 管理
高级用户可手动粘贴 Cookie
获取 Cookie 方法:浏览器登录对应平台 → F12 开发者工具 → Application/存储 → Cookies → 复制全部 Cookie(JSON 格式)粘贴到对应平台输入框
发布测试台
4 阶段测试链路:Cookie检查 → 登录态校验 → 选择器探测 → 上传测试
测试说明:
• Cookie检查:仅检查文件存在性和字段完整性,不访问网络(最安全)
• 登录态校验:实际加载 Cookie 访问平台,检测是否被重定向到登录页
• 选择器探测:打开浏览器访问发布页,检测上传/标题/发布按钮选择器是否有效
• 上传测试:实际上传视频文件,dry-run 模式不点发布按钮;关闭 dry-run 将真实发布视频
状态说明

Ollama / CosyVoice / LatentSync:三大本地依赖服务,由服务监管器自动拉起与健康监测;「启动中」为模型加载(CosyVoice 约 50 秒),稍候自动就绪

FFmpeg:视频处理引擎,必须可用

LLM 模式:「已就绪」=本地 Ollama 或云端 API 正常;「Mock 模式」=未配置,文案走模板

提示:全本地链路(Ollama + CosyVoice + LatentSync)开箱即用,素材不出本机。服务未就绪时点「生成」会给出明确指引。前往「设置中心」可切换 provider 与参数。