IndexTTS 2.5 安装、DeepSpeed 加速与视频中文配音指南
从“在搜索引擎里输入什么”开始,写到命令在哪里输入、正常会返回什么、哪里出错以及如何停止程序释放显存。教程以一台 RTX 4060 Laptop 8 GB 的实际成功环境为基准。
0. 先看完整流程与版本边界
不要一上来就运行 uv sync --all-extras。对 Windows 新手,先让基础 WebUI 跑起来,再单独增加 DeepSpeed,最容易定位问题。
| 项目 | 本教程固定基准 | 为什么固定 |
|---|---|---|
| IndexTTS | 2.5.0 | 不同标签的依赖和参数可能变化。 |
| Python | 3.11 | 项目要求 3.10–3.11;本文 DeepSpeed wheel 是 cp311。 |
| PyTorch | 2.8.0+cu128 | 必须与 DeepSpeed wheel 的编译版本一致。 |
| CUDA | 12.8 | PyTorch wheel 和 DeepSpeed wheel 均为 cu128。 |
| DeepSpeed | 0.17.5+e1560d84 | 本机使用预编译 Windows wheel,完整推理核心已安装。 |
| 稳定启动 | BF16/FP16 参数入口 + DeepSpeed + 24 steps | 另外三条实验加速默认关闭,减少 8 GB 显存和编译风险。 |
1. 检查电脑、显卡和磁盘空间
先确认硬件,再下载十几 GB 文件。CPU 可以运行部分流程,但本教程的加速配置以 NVIDIA GPU 为前提。
| 项目 | 最低建议 | 本机实测 | 说明 |
|---|---|---|---|
| Windows | Windows 10/11 64 位 | Windows 10/11 系列 | 系统必须为 64 位。 |
| GPU | NVIDIA,建议 8 GB 显存 | RTX 4060 Laptop 8 GB | 8 GB 可用 BF16 + DeepSpeed,但不要假设 OOM 会自动溢出到内存。 |
| 系统内存 | 16 GB,建议 32 GB | 按本机配置运行 | 加载模型、浏览器和视频工具会同时占用内存。 |
| 磁盘 | 至少空闲 30–40 GB | .venv 8.49 GiB;checkpoints 10.22 GiB | 还要给 uv/HuggingFace 缓存、输出音频和视频留空间。 |
在 CMD 检查 NVIDIA 驱动
nvidia-sminvcc 工具包版本。nvidia-smi 顶部显示 13.x,表示驱动有能力支持到该版本;真正决定 DeepSpeed 编译匹配的是 nvcc --version 与 torch.version.cuda。这两项在本文配置里都应为 12.8。
2. 从 GitHub 找到并下载 IndexTTS
官方团队明确说明,唯一官方代码仓库是 github.com/index-tts/index-tts。先核对网址和仓库所有者。
方法 A:新手使用浏览器下载 v2.5.0 ZIP
- 打开浏览器,在搜索引擎输入 IndexTTS GitHub。
- 点击标题含 index-tts/index-tts 的结果。地址栏必须是
https://github.com/index-tts/index-tts。 - 在仓库页面右侧找到 Releases,点击进入。
- 选择 IndexTTS-2.5 / v2.5.0。也可以直接打开 v2.5.0 发布页。
- 滚动到页面下方,展开 Assets,点击 Source code (zip)。
- 浏览器通常把它保存到“下载”文件夹。右键 ZIP,选择全部解压缩。
- 把解压后的目录移动到路径较短的位置,例如
C:\AI\index-tts-2.5.0。尽量避免 OneDrive、中文特殊符号和过深目录。
pyproject.toml、uv.lock、webui.py、indextts 和 tools。
方法 B:安装 Git 后克隆代码
在你准备存放项目的父目录打开 CMD,然后输入:
git clone --branch v2.5.0 --depth 1 https://github.com/index-tts/index-tts.git index-tts-2.5.0
cd index-tts-2.5.0Cloning into 'index-tts-2.5.0'... 和下载进度,随后命令提示符末尾变为 \index-tts-2.5.0>。如果你希望跟随开发中的最新版,可以在仓库首页点击绿色 Code 按钮,再点 Download ZIP;但 main 会变化,不保证与本文所有版本号完全一致。
git lfs install 和 git lfs pull。当前 v2.5.0 中文 README 说明示例音频按需下载,不再要求 Git LFS;模型权重仍需按第 6 节单独下载。
3. 在项目目录里打开 CMD
后文没有特别注明时,所有命令都输入在这个黑色“命令提示符”窗口中。不要输入示例里提示符前面的目录文字。
最简单的方法:资源管理器地址栏输入 cmd
- 在资源管理器进入项目目录,确认能看见
webui.py。 - 点击窗口顶部的地址栏,原路径会变成可编辑文字。
- 输入
cmd,按 Enter。 - 黑色窗口打开后,提示符应显示项目路径,例如:
C:\AI\index-tts-2.5.0>如果 CMD 已经打开:用 cd /d 切换目录
cd /d "C:\AI\index-tts-2.5.0"/d 允许同时从 C 盘切换到 D 盘;路径含空格时必须加英文双引号。
确认当前位置正确
dir webui.py pyproject.toml uv.lockC:\...>、解释文字和“正常结果”都不要输入。命令只能使用半角英文引号,不能用弯引号。
4. 安装基础工具
ZIP 用户不强制需要 Git;所有用户都需要 uv。CUDA Toolkit 和 C++ 编译器在基础运行中不是必需,但 DeepSpeed 源码编译和其他内核可能需要。
4.1 Git(推荐)
- 打开 Git for Windows 下载页。
- 下载 64-bit Git for Windows Setup。
- 运行安装程序;新手保留默认选项即可。完成后关闭并重新打开 CMD。
git --versiongit version 2.55.0.windows.5。具体小版本不同没有关系。4.2 uv(必须)
uv 会替项目下载合适的 Python,并创建隔离的 .venv。不建议再混用 Conda 或手动激活虚拟环境。
py -m pip install -U uvSuccessfully installed uv-... 或 Requirement already satisfied。uv --versionuv 0.12.5。若提示不是内部或外部命令,关闭 CMD 后重新打开;仍不行时使用 py -m uv --version。4.3 NVIDIA CUDA Toolkit 12.8(DeepSpeed/编译加速建议安装)
- 打开 NVIDIA 的 CUDA Toolkit 12.8 下载页。
- 依次选择 Windows、x86_64、你的 Windows 版本、exe (local)。
- 运行安装器。选择“自定义”时至少保留 CUDA Toolkit;如果已有更新的显卡驱动,不必强行降级驱动。
- 安装结束后关闭所有 CMD,打开一个新 CMD。
where nvcc
nvcc --versionCUDA\v12.8\bin\nvcc.exe;版本结尾应有 release 12.8。4.4 Visual Studio Build Tools(只在需要编译时安装)
- 打开 Visual Studio Build Tools,点击 Download Build Tools。
- 在 Visual Studio Installer 勾选使用 C++ 的桌面开发。
- 确认右侧包含 MSVC v143、Windows 10/11 SDK、C++ CMake tools,然后安装。
- 验证时从开始菜单打开 x64 Native Tools Command Prompt for VS 2022,输入
cl。
where cl 找不到并不代表没有安装,因为编译器环境变量通常只在 Developer Command Prompt 中加载。cl.exe 或 nvcc 编译 Transformer 内核。安装 Build Tools 主要用于将来的 JIT 内核、FlashAttention 或其他源码包。
5. 先安装能运行的基础依赖
本节必须在项目目录的 CMD 中执行。先只安装 WebUI,暂时不碰 DeepSpeed、FlashAttention 和 torch.compile。
5.1 让 uv 准备 Python 3.11
uv python install 3.115.2 安装核心依赖和网页界面
uv sync --extra webuiResolved ... packages,随后下载并安装,最后没有红色 Failed。项目目录会出现 .venv 文件夹。中国大陆下载 PyPI 较慢时,可以改用下面任意一个镜像;只选一条运行:
uv sync --extra webui --default-index "https://mirrors.aliyun.com/pypi/simple"uv sync --extra webui --default-index "https://pypi.tuna.tsinghua.edu.cn/simple"5.3 验证项目 Python 与 PyTorch
.venv\Scripts\python.exe --version
uv run python -c "import torch; print(torch.__version__); print(torch.version.cuda); print(torch.cuda.is_available()); print(torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'CPU')"Python 3.11.13、2.8.0+cu128、12.8、True、显卡名称。补丁版本可以稍有不同,但 PyTorch CUDA 应为 12.8。--all-extras 会同时安装 WebUI、DeepSpeed、FlashAttention/accel 和 torch.compile 依赖。Windows 上任意一个编译扩展失败,整个同步都会失败。基础版跑通后再逐项增加,出错时才能知道是哪一项。
6. 下载 IndexTTS-2.5 模型权重
代码和模型是分开的。ZIP 下载完成不代表模型已经存在;模型应放到项目的 checkpoints 文件夹。
方法 A:中国大陆优先使用 ModelScope
uv tool install modelscope
uv tool update-shell运行第二条后,关闭 CMD,在项目目录重新输入 cmd 打开新窗口。然后下载:
modelscope download --model IndexTeam/IndexTTS-2.5 --local_dir checkpoints方法 B:使用 HuggingFace
uv tool install "huggingface-hub"
uv tool update-shell重新打开 CMD 后运行:
hf download IndexTeam/IndexTTS-2.5 --local-dir checkpoints访问 HuggingFace 困难时,可在当前 CMD 会话临时指定镜像,再运行下载:
set HF_ENDPOINT=https://hf-mirror.com
hf download IndexTeam/IndexTTS-2.5 --local-dir checkpoints检查模型是否完整
dir checkpoints\config.yaml checkpoints\gpt.pth checkpoints\s2mel.pth checkpoints\codec.pthgpt.pth 约 3.0 GiB,模型目录连同 HuggingFace 缓存约 10.22 GiB。uvx --from modelscope modelscope download --model IndexTeam/IndexTTS-2.5 --local_dir checkpoints。uvx 会临时准备工具并立即执行。
7. 第一次启动、打开网页与正确停止
第一次只启用半精度,不启用 DeepSpeed。这样可以确认代码、模型和显卡本身没有问题。
uv run webui.py --version 2.5 --fp16 --host 127.0.0.1 --port 7860IndexTTS 2.5 中,项目的 --fp16 参数入口会选择支持的半精度路径;在支持 BF16 的 NVIDIA GPU 上使用 BF16。它能显著减少显存,通常不会造成可察觉的质量下降。
http://127.0.0.1:7860 的本地地址。- 不要关闭 CMD。
- 打开浏览器,在地址栏输入 http://127.0.0.1:7860。
- 如果网页没有自动刷新,等待模型加载完成后按一次刷新。
正确停止并释放内存/显存
- 回到正在运行 WebUI 的 CMD 窗口。
- 按 Ctrl + C。
- 等命令提示符重新出现。此时再关闭窗口。
端口占用时找到进程
netstat -ano | findstr :7860最后一列是 PID。确认它确实属于 IndexTTS 后,才运行:
taskkill /PID 这里替换成实际PID /T /F8. 在 Windows 上正确安装 DeepSpeed 0.17.5
DeepSpeed 只影响推理速度和内存执行方式,不提高音质。官方 v2.5.0 的 pyproject.toml 仍依赖 0.17.1,Windows 会尝试源码编译;本机改为与 PyTorch 2.8/cu128 匹配的 0.17.5 预编译 wheel。
8.1 先确保真正生效的是 CUDA 12.8
where nvcc
nvcc --version
uv run python -c "import torch; print(torch.__version__); print(torch.version.cuda)"2.8.0+cu128;torch.version.cuda 为 12.8。如果已经安装 12.8,但 nvcc --version 仍显示 13.3,可先只修正当前 CMD 会话:
set "CUDA_PATH=C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.8"
set "PATH=%CUDA_PATH%\bin;%CUDA_PATH%\lib\x64;%PATH%"
where nvcc
nvcc --version永久修改请在 Windows 搜索“编辑系统环境变量” → “环境变量”,把 CUDA_PATH 指向 v12.8,并让 v12.8 的 bin 排在 v13.3 前。不要使用 setx PATH ... 整体重写 PATH,它可能截断或破坏现有内容。
8.2 修改官方 v2.5.0 的 DeepSpeed 版本和 wheel 来源
- 在项目目录找到
pyproject.toml,右键用记事本或代码编辑器打开。 - 按 Ctrl + F 搜索
deepspeed==0.17.1,改成deepspeed==0.17.5。 - 继续找到
[tool.uv.sources]。紧接在它下面、现有torch = [之前,加入下列内容。
deepspeed = [
{ url = "https://github.com/6Morpheus6/deepspeed-windows-wheels/releases/download/v0.17.5/deepspeed-0.17.5%2Be1560d84-2.8torch_cu128-cp311-cp311-win_amd64.whl", marker = "sys_platform == 'win32' and python_version == '3.11'" },
]保存 pyproject.toml,回到项目 CMD:
uv lock --upgrade-package deepspeed
uv sync --extra webui --extra deepspeeddeepspeed==0.17.5+e1560d84,直接安装 win_amd64 wheel,不再出现 Failed to build deepspeed。8.3 验证 DeepSpeed 版本和完整推理内核
uv run python -c "import torch, deepspeed; print(torch.__version__); print(torch.version.cuda); print(deepspeed.__version__)"2.8.0+cu128、12.8、0.17.5+e1560d84。uv run python -m deepspeed.env_reporttransformer_inference [YES] [OKAY]、inference_core_ops [YES] [OKAY],并且底部显示 wheel compiled with torch 2.8 / cuda 12.8。| 报告项目 | 本机状态 | 是否影响 IndexTTS 推理 |
|---|---|---|
| transformer_inference | YES / OKAY | 关键,表示完整 Transformer 推理内核已安装。 |
| inference_core_ops | YES / OKAY | 关键。 |
| fused_adam / cpu_adam | YES / OKAY | 已安装,但更多用于训练/优化器。 |
| async_io | NO / NO | Windows 缺少 Linux libaio 很常见;本流程不依赖。 |
| gds / cufile | NO / NO | 本流程不依赖。cufile.lib 警告可忽略。 |
| sparse_attn | NO / NO | 旧版稀疏注意力与 Torch 2.8 不兼容,不是本流程所需。 |
9. 加速开关、音质和本机推荐配置
更多开关不等于更快。首次编译、8 GB 显存竞争、内核兼容性和文本长度都可能让“全开”反而更慢。
| 参数 | 作用 | 通常影响音质吗 | RTX 4060 8 GB 建议 |
|---|---|---|---|
--fp16 | 2.5 在支持时使用 BF16/半精度,降低显存与计算量。 | 通常几乎无可察觉差异。 | 开启。 |
--deepspeed | 使用 DeepSpeed Transformer 推理路径。 | 设计上不改变目标质量。 | 已验证,可开启;仍应与无 DeepSpeed 实测比较。 |
--cuda_kernel | 使用额外 CUDA kernel。 | 通常不改变质量,可能有细微数值差异。 | 稳定配置关闭。 |
--accel | GPT2/FlashAttention 加速引擎。 | 通常不以降低质量为目标。 | 安装与显存风险较高,稳定配置关闭。 |
--torch_compile | 编译 s2mel 图,后续调用可能更快。 | 通常不改变质量。 | 首次编译慢且吃内存,稳定配置关闭。 |
INDEXTTS_DIFFUSION_STEPS | 扩散迭代步数。 | 可能影响细节和稳定性。 | 保存值为 24;追求速度可自行听测更低值。 |
本机保存的稳定启动命令
set INDEXTTS_DIFFUSION_STEPS=24
uv run --no-sync webui.py --version 2.5 --fp16 --deepspeed --host 127.0.0.1 --port 7860--no-sync 表示直接使用已经安装好的环境,启动时不重新解析依赖。只有在 uv sync 已成功后使用。
创建双击启动的 BAT 文件
- 在项目目录右键 → 新建 → 文本文档。
- 改名为
start_indextts_deepspeed_24.bat。确认扩展名不是.bat.txt。 - 用记事本打开,粘贴以下内容并保存。
@echo off
setlocal
cd /d "%~dp0"
set "INDEXTTS_DIFFUSION_STEPS=24"
set "PYTHONUTF8=1"
".venv\Scripts\python.exe" webui.py --version 2.5 --fp16 --deepspeed --host 127.0.0.1 --port 7860
pause
endlocal扩散步数实测记录(仅代表本机当时状态)
| Steps | 生成耗时 | 音频时长 | 说明 |
|---|---|---|---|
| 8 | 56.668 s | 3.704 s | 最快一档;用户听感与高步数接近。 |
| 10 | 67.594 s | 3.704 s | 同一音色、种子和中文句子。 |
| 12 | 76.010 s | 3.704 s | 同上。 |
| 14 | 85.801 s | 3.704 s | 同上。 |
| 16 | 95.769 s | 3.704 s | 同上。 |
| 18 | 105.373 s | 3.704 s | 同上。 |
| 20 | 112.720 s | 3.704 s | 同上。 |
| 22 | 72.891 s | 3.704 s | 运行状态变化导致非单调,不能当理论规律。 |
| 24 | 77.976 s | 3.704 s | 保存为质量优先启动值。 |
10. 使用普通文字转语音功能
这个页面只根据文本生成自然语音,不使用视频时间轴对齐,也不通过 FFmpeg 强制改变语速。
- 启动 WebUI,打开
http://127.0.0.1:7860。 - 在第一个文字转语音页面上传“音色参考音频”。
- 语言选择 ZH,在文本框输入中文。
- 需要稳定高质量时,在预设中选择质量优先。
- 点击生成,等待网页播放器出现结果。
怎样准备更像的参考音频
- 推荐有效人声约 6–12 秒;本视频流程默认提取 12 秒。
- IndexTTS 读取参考音频时最多使用前 15 秒。超过 15 秒不会继续增加有效参考信息。
- 只包含一个人,背景音乐、混响、风噪和长静音越少越好。
- 语速、情绪、麦克风距离尽量稳定;不要截在单词或爆破音中间。
- 跨语言音色克隆可以“英文参考 → 中文输出”;模型 2.5 原生支持这种跨语言合成。
长文本如何分句
本机定制版优先把每个非空换行当作一条完整话语。下面输入会生成三句话:
这是第一句话。
这是第二句话。
这是第三句话。- 没有手动换行时,程序按
。、!、?等句末标点拆分。 - 普通默认上限为每段 120 Token;“质量优先”预设提高到 160 Token。
- 超过上限时才继续按逗号等较弱边界拆分,以避免 8 GB 显存溢出。
- 不要简单按“40 个字符”机械切割,否则容易出现语气跳变和明显拼接感。
| 设置 | 普通默认 | 质量优先 |
|---|---|---|
| 每段最大 Token | 120 | 160 |
| 采样 | 按当前界面 | 关闭随机采样 |
| Beams | 1 | 3 |
| 时长系数 | 1.0 | 1.0 |
| 用途 | 速度与稳定性平衡 | 优先稳定和文本一致性,通常更慢、更吃显存 |
11. 本机定制的视频中文配音流程
目标是输入本地视频路径,提取英文 SRT;人工或其他 AI 翻译后,再读取中文 SRT 生成一条中文 WAV。流程不会自动替换视频音轨,也不会把字幕重新封装进 MP4。
11.1 安装 Shotcut
- 打开 Shotcut 官方下载页。
- 选择 Windows installer,运行安装程序。
- 建议使用默认目录
C:\Program Files\Shotcut。定制流程直接调用其中的ffmpeg.exe和ffprobe.exe,不需要每次操作 Shotcut 图形界面。
若安装到其他目录,启动前在 CMD 设置:
set "SHOTCUT_ROOT=D:\你的软件目录\Shotcut"11.2 下载 Whisper large-v3 模型
- 在 C 盘新建
C:\models文件夹。 - 浏览器打开 ggml-large-v3.bin 模型页,点击下载按钮。
- 国内网络可尝试镜像直链:hf-mirror large-v3。
- 最终完整路径必须为
C:\models\ggml-large-v3.bin,不要保留浏览器附加的.download或.tmp。
dir "C:\models\ggml-large-v3.bin"large-v3 可以识别多种语言,也能用于英文语音转英文 SRT,但它不是通用的“英文 → 中文”文本翻译器。本流程让 large-v3 负责准确听写英文,再把 english.srt 交给其他 AI 翻译成中文。
11.3 第一步:提取英文字幕和音色参考
- 启动本机定制 WebUI,切换到视频中文配音标签。
- 在“本地视频路径”粘贴完整路径,例如
C:\Users\name\Videos\example.mp4。网页输入框不需要额外加引号。 - 点击提取英文字幕。
- 如果 MP4 内嵌英文字幕流,程序直接提取;否则调用 Shotcut/Whisper large-v3 识别。
- 程序还会提取约 12 秒固定音色参考,供后面的中文 TTS 使用。
结果目录位于:
11.4 第二步:翻译并保存完整中文字幕
- 打开网页显示的
english.srt。 - 把完整文件交给可信的翻译 AI,要求保留每一个编号和时间码,只翻译字幕正文。
- 不要翻译 Claude、Claude Design、prototype、wireframe 等你希望保留的英文名词。
- 保存为 UTF-8 编码,文件名为
translated.zh.srt,放回同一结果目录。 - 回到网页,确认“翻译后的中文字幕”输入框是完整路径,开头必须含盘符和反斜杠,例如
C:\...。
正确 SRT 块的格式如下:
1
00:00:00,291 --> 00:00:02,457
Claude Design 刚刚由
2
00:00:02,458 --> 00:00:04,208
Claude 的开发团队发布。很多人称它为定制流程不会把每个编号误当成一句话。它会根据句末标点跨块重组,例如上面第 1、2 块的前半部分会合成:
本次实际文件从 303 个 SRT 块重组为 130 个完整句子;130 句全部以句末标点结束,没有在这份视频中触发 15 秒保护性硬拆分。
视频已有 chi 中文字幕时
不需要重新翻译。把该中文字幕导出为标准 UTF-8 SRT,保存或填写为 translated.zh.srt,然后按英文字幕对照检查错译。当前定制网页能直接读取这个中文 SRT 生成配音,但官方原版和当前“提取英文字幕”按钮不保证自动替你导出所有 chi 流。
11.5 第三步:选择配音参考模式并生成
固定音色参考
整段只使用同一个 12 秒左右的参考。逐句不提取英文原音,速度更快,整段音色与总体语气更稳定。
固定音色 + 逐句情感参考
说话人音色保持固定,同时按重组句子的 SRT 时间从原视频提取对应英文音频,传递每句情绪和语气。默认选择此模式。
- 在“配音参考模式”选择一种模式。
- 点击生成中文配音。
- 保持网页和 CMD 打开,不要刷新或切走页面。
- 完成状态会显示 SRT 块数、重组句数、情感参考数、总耗时、最大顺延和尾部延长。
- 结果是同目录下的
chinese_dub.wav,网页也会显示播放器。
时间轴规则
- 不使用 FFmpeg
atempo强制变速。 - 不截掉长句结尾,不让相邻句音频重叠。
- 中文比 SRT 时间窗短:保留自然空白。
- 中文比时间窗长:下一句自然顺延,状态中记录最大漂移;视频末尾也可能延长。
- 视频模式内部
interval_silence=0,没有额外 140 ms 停顿,也没有新增句段边缘淡化。
chinese_dub.wav 的修改时间。长任务期间最好不要刷新页面;需要停止时回到 CMD 按 Ctrl+C。
12. 常见错误逐项解决
先读错误末尾最具体的一行,不要只看最上面的 “Failed”。下面按本次安装实际遇到的问题整理。
Failed to build deepspeed / CUDA 13.3 与 torch 12.8 不匹配
原因:DeepSpeed 0.17.1 正在源码编译,并调用了 PATH 中排在最前面的 CUDA 13.3 nvcc;PyTorch 却是 cu128。
解决:按第 8 节让 nvcc --version 变为 12.8,并切换到匹配的 0.17.5 预编译 wheel。不要跳过严格版本检查。
明明安装了 CUDA 12.8,错误里仍然显示 13.3
安装只是把新版本放进电脑,不会自动把它排到 PATH 最前。运行 where nvcc 会列出多个版本;程序使用第一条。修正 CUDA_PATH 和 PATH 顺序,关闭并重新打开 CMD。
构建日志说 No module named numpy
这是 DeepSpeed 构建隔离环境中的伴随警告,当前日志真正终止构建的是 CUDAMismatchException。先修 CUDA 与 wheel;不要只围绕 NumPy 反复安装。
cl.exe 找不到,但我已经安装 Visual Studio Build Tools
普通 CMD 不一定包含 MSVC 环境。打开“x64 Native Tools Command Prompt for VS 2022”再输入 cl。如果使用本文预编译 DeepSpeed wheel,正常安装和推理本身无需 cl.exe。
DeepSpeed 报 aio.lib 或 cufile.lib 链接错误
环境报告在检测 Windows 不支持或未配置的 async_io/GDS 功能时可能打印这些信息。只要 transformer_inference 与 inference_core_ops 为 YES/OKAY,IndexTTS 推理内核仍可正常使用。
CUDA out of memory / 显存不足
- 停止其他 TTS、游戏、视频增强和占用 GPU 的浏览器任务。
- 保留
--fp16,不要使用--qwen_emo。 - 关闭
--torch_compile、--accel、--cuda_kernel做基线。 - 把单句 Token 从 160 降回 120 或更低,并按完整句子换行。
- 停止程序后重新启动,清理碎片化显存。
网页打不开 / 127.0.0.1 拒绝连接
检查启动 CMD 是否仍在运行、是否已经打印本地 URL。用 netstat -ano | findstr :7860 检查监听。模型还在加载时先等待,不要反复启动多个实例。
端口 7860 已被占用
优先停止旧 WebUI;也可以临时换端口:
uv run --no-sync webui.py --version 2.5 --fp16 --deepspeed --host 127.0.0.1 --port 7861随后打开 http://127.0.0.1:7861。
中文字幕文件不存在:C:Users\...\translated.zh.srt
路径缺少 C: 后面的反斜杠,或文件尚未保存。正确形式是 C:\Users\...\translated.zh.srt。在资源管理器按住 Shift 右键文件,可选择“复制文件地址”。
为什么不能直接用 large-v3 英译中
Whisper large-v3 的翻译任务只输出英文。它可以高质量听写英文,但英文到中文文本翻译要使用其他翻译模型或 AI。翻译后保留 SRT 时间码,再交给 IndexTTS 生成中文音频。
生成音频很快、语气不自然或有拼接感
检查参考音频是否干净、文本是否有完整标点、是否把大量文字塞在同一句、时长系数是否小于 1。优先按完整句子换行,使用 6–12 秒清晰参考;不要用机械 40 字切割或 FFmpeg 强制变速补救。
语音里把 Claude 听成 clawed
这是语音识别阶段的同音误识别,不是 TTS 本身。先在英文/中文字幕 SRT 中把 clawed 统一改回 Claude,再生成中文配音。不要把你希望保留的英文产品名翻译掉。
13. 更新、备份与释放资源
本机项目已经修改过依赖和 WebUI。直接覆盖或 git pull 可能冲掉定制功能,更新前先备份。
建议备份的内容
webui.pytools\web_video_dubbing.py以及其他新增工具脚本pyproject.toml和uv.lockstart_indextts_deepspeed_24.batoutputs\video-dubbing中的 SRT、参考音频和最终 WAV
更新依赖后的标准动作
uv sync --extra webui --extra deepspeed如果没有明确升级需求,不要随意删除 uv.lock。锁文件保证下次仍安装已验证的组合。
不用 TTS 时释放 GPU
- 启动 CMD 中按 Ctrl+C。
- 运行
netstat -ano | findstr :7860,确认没有 LISTENING。 - 运行
nvidia-smi,确认没有项目 Python 进程。
需要释放磁盘空间时
确认不再需要后,可以在资源管理器中删除以下目录;这是卸载而不是普通清理:
.venv:释放约 8.49 GiB,之后必须重新uv sync。checkpoints:释放模型及缓存约 10.22 GiB,之后必须重新下载模型。outputs:会删除已经生成的字幕和音频,先备份需要的结果。
完成检查表
所有项目都满足后,环境才算真正安装完成。勾选状态只保存在当前浏览器。
- 项目目录能直接看到
webui.py和pyproject.toml。 uv --version能输出版本。.venv\Scripts\python.exe --version为 Python 3.11。- PyTorch 输出
2.8.x+cu128、CUDA 12.8、GPU 可用 True。 checkpoints中的 config、gpt、s2mel、codec 文件都存在。- 不带 DeepSpeed 的基础 WebUI 能启动并生成一段音频。
- 如使用 DeepSpeed/编译内核,
nvcc --version为 12.8。 - DeepSpeed 为 0.17.5,Transformer inference 和 inference core ops 为 YES/OKAY。
- 知道必须在 CMD 按 Ctrl+C 才能释放模型和显存。
- 使用视频定制功能时,Shotcut 和
C:\models\ggml-large-v3.bin均存在。 - 知道 large-v3 负责英文听写,中文翻译文件必须保留 SRT 编号和时间码。
- 参考音色已取得合法授权。
官方与相关来源
- IndexTTS 官方 GitHub 仓库
- IndexTTS v2.5.0 发布页
- IndexTTS 官方中文 README
- IndexTTS-2.5 ModelScope 模型
- IndexTTS-2.5 HuggingFace 模型
- uv 官方安装文档
- Git for Windows
- NVIDIA CUDA Toolkit 12.8
- Visual Studio Build Tools
- Shotcut 官方下载
- whisper.cpp ggml-large-v3.bin
- 第三方 DeepSpeed Windows 0.17.5 wheel
本文中的本机版本、磁盘占用、扩散步数耗时和 DeepSpeed 内核状态来自 2026-08-26 的实际环境检查。软件更新后应重新核对官方 README、依赖锁文件和发行说明,不应把单机耗时当作所有设备的固定性能。
把本文部署到网站
- 将这个 HTML 文件和同级的
assets文件夹一起上传到网站的静态资源目录。HTML 可改名为indextts-windows-guide.html;若它要作为独立站首页,可改名为index.html。 - 页面不需要 PHP、Python、Node.js 或数据库。章节勾选和深色模式使用浏览器
localStorage,只保存在访问者自己的设备。 - 页面通过 HTTPS 引用 IndexTTS 官方标志和 Lucide 图标 CDN。若网站内容安全策略禁止外部资源,正文仍可阅读,按钮会显示内置备用符号;也可以把这些资源下载到自己网站后修改
src。 - 发布后检查手机和桌面页面,并定期核对官方版本。不要删除第三方 DeepSpeed wheel 的来源提示。