首页
AI 视频翻译工作台 AI 语音转文字 AI 字幕翻译 AI 文本配音 AI 视频总结 字幕擦除 视频切片
价格 使用文档 公告动态 关于我们
开始翻译
使用文档

快速上手,十分钟玩转

从零开始完成第一个视频翻译任务,以及 7 大 AI 工具的详细使用说明

快速开始

  1. 注册 / 登录:点击右上角「登录」,新用户注册即送 60 积分(可完成约 1 小时视频处理)。
  2. 从导航「AI 工具」进入 语音转文字视频翻译工作台
  3. 拖入视频文件,或粘贴 YouTube / B站 / 抖音 等链接。
  4. 选择视频原语言(不确定选「自动识别」)和目标语言(支持 34 种)。
  5. 选择处理模式:仅字幕 / 字幕+配音 / 仅配音 / 仅字幕文件。
  6. 选择音色(推荐「自动」),点击「提交」。
  7. 等待处理完成,下载视频 / 字幕 / 配音音频
全程云端引擎处理,无需下载任何模型,打开即可使用。

7 大 AI 工具

每个工具都是独立页面,单独提交、单独下载,互不干扰:

工具入口功能
语音转文字/zh/tools/transcribe上传音/视频 → 识别语音 → 生成带时间轴字幕(SRT/TXT)
字幕翻译/zh/tools/subtitle上传 SRT → 一键翻译 34 种语言,时间轴原样保留
文本配音/zh/tools/tts文本 → 300+ 音色 AI 配音,可调语速,生成 mp3
视频总结/zh/tools/summarize长视频/音频 → 自动提炼核心要点与概述
字幕擦除/zh/tools/video划框精准遮挡视频内硬字幕 / 水印
视频切片/zh/tools/clip按起止秒数截取视频片段
声音克隆/zh/tools/clone上传 10 秒人声样本 → 克隆专属音色 → 永久保存

需要全流程一站式处理(识别 → 翻译 → 配音 → 合成)时,使用「AI 视频处理工作台」(/workspace/workbench)。

️ 识别引擎(ASR)配置

平台使用云端识别引擎,识别质量对标行业标杆,无需下载任何本地模型:

  • 阿里百炼 Paraformer(默认,最准):流式识别 paraformer-realtime-v2,支持 50+ 语言、自动标点、数字规整。填 DashScope API Key。
  • 火山引擎 ASR:抖音同源 bigmodel 大模型档,填 AppID + Token。
  • 腾讯云 ASR:录音文件识别,填 SecretId + SecretKey。

在工作台「️ 云端服务设置」面板填入对应 Key 即用,每个引擎可「测试连接」验证。

️ 未配置 Key 的引擎不可用,任务会提示配置,不会静默回退或报错中断。

翻译模型配置

支持多家大模型,在工作台「️ 配置」面板填写:

  • Kimi(kimi-k3):擅长复杂句子与专业术语。填 API Key。
  • DeepSeek:流畅自然,性价比高(推荐)。填 API Key。
  • OpenAI 兼容:可接通义 / 302.AI / 硅基流动等。填 Base URL + API Key + 模型名。
  • 百度翻译:通用 API,免费额度。填 APP ID + 密钥。

默认「自动」模式会按 Kimi → DeepSeek → OpenAI → 百度 顺序逐级兜底,一个挂了自动切换下一个。

每个模型可单独「测试连接」,配置后立即验证是否可用。

配音引擎(TTS)配置

  • Edge(默认):微软在线神经语音 300+ 音色,零配置即用。
  • MiniMax(云端):中文配音天花板,speech-02-hd 情感/音质接近真人。填 MiniMax API Key + GroupId。
  • 阿里百炼 CosyVoice(云端):通义实验室情感语音,与百炼 ASR 共用 DashScope Key。
  • OpenAI 兼容:可接任意 /v1/audio/speech 接口(302.AI 等)。填 Base URL + Key + 模型名。
  • 本地 TTS 服务:填自部署服务的 URL(需 GPU),数据不出内网。

已配置的云端引擎会自动排在音色下拉框最前;Edge 失败时自动降级到已配置的云端引擎,任务不会中断。

音色下拉框每个音色可「 试听」,喜欢的点「 收藏」自动置顶。

声音克隆

  1. 进入「声音克隆」工具页(/zh/tools/clone)。
  2. 上传 10 秒以上清晰人声样本(支持音频或视频文件,视频自动提取音轨)。
  3. 点击「克隆」,等待生成(云端 MiniMax 处理,约 1 分钟)。
  4. 克隆音色永久保存在个人账户,之后可在任意配音任务中选用。
️ 样本越清晰、越长,克隆效果越好。建议使用无背景音乐、无混响的干净人声。

多人对话配音

适合访谈、课堂、影视解说等多说话人视频。

  1. 配音设置里把「多人配音」选为开启
  2. 系统自动识别每位说话人(男声/女声/儿童/老人)。
  3. 可为每个说话人指定音色(留空自动分配)。
️ 说话人分离依赖本地部署的 pyannote 模型;未部署时会自动降级为单音色配音,不影响任务完成。

积分与计费

平台采用积分制,无需预付费订阅,用多少扣多少:

  • 注册即送 60 积分,可免费体验完整流程。
  • 积分按处理时长 / 字符数扣除,详见「个人中心 → 积分明细」。
  • 积分不足时可购买积分包:500 积分(¥9.9)/ 2000 积分(¥29)/ 8000 积分(¥99)。
任务类型计费方式费率
语音转文字 / 字幕翻译 / 视频总结 / 字幕擦除 / 视频切片按音视频时长1 积分 / 分钟
文本配音 / 字幕配音按字符数1 积分 / 200 字符
链接下载转字幕按音视频时长2 积分 / 分钟
任务失败不扣积分;处理中可随时取消。

常见问题

为什么首次处理很慢?

首次使用某个云端引擎会建立连接并预热,之后速度恢复正常。视频较长时,识别与配音本身需要一定处理时间。

视频最长支持多少?

浏览器上传限制单文件 ≤ 4GB(建议)。链接下载无此限制。

可以批量处理吗?

可以。工作台勾选「 批量模式」后一次选择多个视频,逐个排队自动执行。

翻译质量能达到行业标杆吗?

识别与翻译均接入与行业标杆同源的云端引擎(阿里百炼/火山/腾讯 + Kimi/DeepSeek 大模型),并支持字幕精修,成片质量完全可对标。

数据安全吗?

识别与配音均通过各云厂商官方 API 加密传输,仅上传必要的音视频片段用于处理,不留存、不用于训练。

积分用完了怎么办?

在「个人中心 → 充值」购买积分包,支持多种支付方式,到账即时可用。