从零开始完成第一个视频翻译任务,以及 7 大 AI 工具的详细使用说明
YouTube / B站 / 抖音 等链接。每个工具都是独立页面,单独提交、单独下载,互不干扰:
| 工具 | 入口 | 功能 |
|---|---|---|
| 语音转文字 | /zh/tools/transcribe | 上传音/视频 → 识别语音 → 生成带时间轴字幕(SRT/TXT) |
| 字幕翻译 | /zh/tools/subtitle | 上传 SRT → 一键翻译 34 种语言,时间轴原样保留 |
| 文本配音 | /zh/tools/tts | 文本 → 300+ 音色 AI 配音,可调语速,生成 mp3 |
| 视频总结 | /zh/tools/summarize | 长视频/音频 → 自动提炼核心要点与概述 |
| 字幕擦除 | /zh/tools/video | 划框精准遮挡视频内硬字幕 / 水印 |
| 视频切片 | /zh/tools/clip | 按起止秒数截取视频片段 |
| 声音克隆 | /zh/tools/clone | 上传 10 秒人声样本 → 克隆专属音色 → 永久保存 |
需要全流程一站式处理(识别 → 翻译 → 配音 → 合成)时,使用「AI 视频处理工作台」(/workspace/workbench)。
平台使用云端识别引擎,识别质量对标行业标杆,无需下载任何本地模型:
paraformer-realtime-v2,支持 50+ 语言、自动标点、数字规整。填 DashScope API Key。在工作台「️ 云端服务设置」面板填入对应 Key 即用,每个引擎可「测试连接」验证。
支持多家大模型,在工作台「️ 配置」面板填写:
默认「自动」模式会按 Kimi → DeepSeek → OpenAI → 百度 顺序逐级兜底,一个挂了自动切换下一个。
speech-02-hd 情感/音质接近真人。填 MiniMax API Key + GroupId。/v1/audio/speech 接口(302.AI 等)。填 Base URL + Key + 模型名。已配置的云端引擎会自动排在音色下拉框最前;Edge 失败时自动降级到已配置的云端引擎,任务不会中断。
音色下拉框每个音色可「 试听」,喜欢的点「 收藏」自动置顶。
/zh/tools/clone)。适合访谈、课堂、影视解说等多说话人视频。
平台采用积分制,无需预付费订阅,用多少扣多少:
| 任务类型 | 计费方式 | 费率 |
|---|---|---|
| 语音转文字 / 字幕翻译 / 视频总结 / 字幕擦除 / 视频切片 | 按音视频时长 | 1 积分 / 分钟 |
| 文本配音 / 字幕配音 | 按字符数 | 1 积分 / 200 字符 |
| 链接下载转字幕 | 按音视频时长 | 2 积分 / 分钟 |
首次使用某个云端引擎会建立连接并预热,之后速度恢复正常。视频较长时,识别与配音本身需要一定处理时间。
浏览器上传限制单文件 ≤ 4GB(建议)。链接下载无此限制。
可以。工作台勾选「 批量模式」后一次选择多个视频,逐个排队自动执行。
识别与翻译均接入与行业标杆同源的云端引擎(阿里百炼/火山/腾讯 + Kimi/DeepSeek 大模型),并支持字幕精修,成片质量完全可对标。
识别与配音均通过各云厂商官方 API 加密传输,仅上传必要的音视频片段用于处理,不留存、不用于训练。
在「个人中心 → 充值」购买积分包,支持多种支付方式,到账即时可用。