隐私与广告选择

Git-Stars 会使用必要存储来保障网站运行。可选分析和广告测量脚本默认不加载,只有在你同意后,Google 等合作伙伴才可能按要求使用 Cookie 或类似标识符。 隐私政策

LogoGit-Stars
星数最高飙升榜AI Agent每日推荐爆款仓库洞察
LogoGit-Stars

用真实 GitHub 数据发现高价值开源项目

GitHub
Built withLogo of Git-StarsGit-Stars
排行榜
  • 星数最高
  • 飙升榜
  • AI Agent
  • 每日推荐
  • 搜索
资源
  • 洞察
  • 编辑政策
关于
  • 关于
  • 联系我们
法律
  • 隐私政策
  • 服务条款
© 2026 Git-Stars. All Rights Reserved.
返回爆款仓库
AI / Audiotext-to-speechzero-shot-ttsvoice-cloningai-audiobilibiliopen-source-tts

IndexTTS2:B 站开源的零样本语音合成,能克隆音色、控制情绪,但许可证要注意

IndexTTS2 是 B 站发布的工业级零样本语音合成系统,只需一条参考音频就能克隆音色,并支持情感控制、中文拼音级发音控制与中英双语合成。代码和模型已公开,但采用 B 站自定义许可证:小型团队可以商用,大型企业需单独授权,且禁止用该模型优化其他 AI 模型。部署需要 GPU 和 CUDA 12.8+,对非开发者不算友好。

发布时间: 8/8/2026index-tts/index-tts
查看 GitHub查看全部分析

你应该先知道什么

继续往下看完整分析、替代方案和部署建议。

部署难度6/10
商业可用性4/10
能力上限8/10

仓库事实卡

仓库概览

Stars

22,468

Forks

2,734

未解决 Issue

379

许可证

Other

是否开源

是

阅读路线

先看上面的三张判断卡,再看“解决了什么问题”和“商用条件”,最后再决定要不要真的部署。

30 秒快速判断

先看结论,再决定值不值得深入研究。

分数不只是高低,它们代表的是实际采用时的阻力。

部署门槛

Setup is not trivial: it requires GPU, CUDA Toolkit 12.8+, uv package manager, and separate model weight download. The WebUI is easy to start once dependencies are installed, but the repository history reset and specific prerequisites add friction. A team with GPU infrastructure and Python experience can deploy it, but it's not plug-and-play.

商业可用性

The license is a custom Bilibili agreement with significant restrictions. Commercial use is allowed for smaller entities, but large companies (MAU >100M or revenue >1B RMB) need a separate license. Additionally, the model cannot be used to improve other AI models except for non-commercial ones, which limits derivative work. This makes it risky for many commercial applications.

能力上限

The repo delivers state-of-the-art zero-shot TTS with emotional and multilingual support, covering a wide range of voice cloning and expressive speech use cases. However, the promised precise duration control is not yet enabled, and random sampling can reduce fidelity. Teams with advanced TTS needs may outgrow it, but for most realistic scenarios it is highly capable.

它解决了什么实际问题

传统 TTS 需要为每个说话人训练模型,或者只能输出平淡的语音。IndexTTS2 解决了三个问题:一,用一条参考音频即可完成声音克隆,无需微调;二,用情感音频、8 维情感向量或自然语言描述来控制语气,让 AI 语音有情绪;三,通过拼音级发音控制,减少中文多音字和生僻字的错误。它还设计了时长控制,为视频配音对口型提供可能。

为什么大家在用它

语音合成正在从‘像机器说话’走向‘像真人表达’。IndexTTS2 把零样本音色克隆、情感控制、多语言合成打包在一个工业级系统里,且来自 B 站这样的头部视频平台,意味着它针对视频配音、内容创作等真实场景做了优化。虽然许可证有限制,但它给开发者和创作者提供了一个当前 SOTA 级别的、可本地运行的参考实现。

开源与商用条件

严格来说,它不完全是 OSI 定义下的‘开源’。仓库代码公开,但许可证是 B 站模型使用许可协议(SPDX 标为 NOASSERTION),属于自定义许可证。官方允许全世界范围内的非独占、免费、有限许可,但有以下关键限制:如果产品月活超过 1 亿或年收入超 10 亿人民币,必须单独向 B 站申请书面授权;不得用该模型或衍生作品去优化任何 AI 模型,除非是非商业 AI 模型或 B 站 IndexTTS2 自身。另外,模型权重需要从 HuggingFace 或 ModelScope 单独下载,并非随代码自动获得。

不懂代码的人怎么用

如果你不是开发者,也可以体验,但需要有人帮你完成初始部署。项目提供了一个本地 WebUI,启动后访问 http://127.0.0.1:7860,上传参考音频、输入文本、选择情感和语言,即可生成语音。它不需要注册外部 API,完全本地运行。但请记住:它没有打包成一键安装的桌面应用,也没有云端 demo,所以非技术用户最好等待第三方封装或在线体验版。

如何借助 Codex 或 Claude 部署

部署步骤大致如下:1) 准备一台带 NVIDIA GPU 的 Linux/Windows 机器,安装 CUDA Toolkit 12.8 或更高版本;2) 安装 git、git-lfs 和 uv 包管理器;3) 克隆仓库(注意:官方曾重置历史,先删除旧 clone 再重新拉取);4) 进入目录执行 `uv sync --all-extras` 安装依赖;5) 从 HuggingFace 或 ModelScope 下载 IndexTTS-2 模型权重并放到指定路径;6) 运行 `uv run webui.py`;7) 打开 http://127.0.0.1:7860 使用。可选参数包括 `--fp16`、`--accel`、`--torch_compile` 加速推理。首次运行会自动下载小型辅助模型。整个过程需要一定的命令行和 GPU 环境配置经验。

它的能力上限在哪里

根据论文,IndexTTS2 在词错误率、说话人相似度和情感保真度上达到 SOTA,但当前版本并未启用 README 中承诺的‘精确时长控制’,所以指望它能精确对齐视频口型还不行。另外,推理时开启随机采样会降低克隆相似度。它更适合情感丰富的有声内容、多语言配音和低延迟克隆,而不是需要逐字对时长的精细编辑。

完整正文

项目概览

IndexTTS2 是 B 站开源的一款工业级零样本语音合成系统。它只需要一条参考音频,就能克隆说话人音色,并合成中文、英文及跨语言语音。官方同时公布了论文和模型权重,定位是‘可控、高效的零样本 TTS’。

核心特点包括:

  • **零样本音色克隆**:单个参考音频即可模拟目标说话人,无需微调。
  • **情感控制**:支持用情感音频、8 维情感向量或自然语言描述来控制语气。
  • **中文拼音级控制**:可以精确指定每个字的发音,减少多音字错误。
  • **多语言/跨语言**:目前演示了中文和英文,跨语言场景下也能保持音色。
  • **时长控制(未启用)**:论文提出了精确时长控制架构,但当前 release 尚未启用。

解决什么问题?

传统 TTS 的痛点在于:克隆声音需要大量训练数据,合成语音缺乏情绪,多音字容易读错。IndexTTS2 用零样本范式省去了训练步骤,用情感提示解决了表达力问题,用拼音级控制提升了中文准确性。视频配音、有声书、角色语音、多语言内容创作都是它的理想场景。

开源与许可证

需要明确:这是‘代码公开 + 自定义许可证’的项目,不是传统意义的开源软件。许可证要点:

  • 小型实体可以商用,但必须遵守所有条款。
  • 产品月活超 1 亿或年收入超 10 亿人民币的公司,需要单独联系 B 站获取书面许可。
  • 禁止用该模型或衍生作品改进其他 AI 模型(非商业 AI 模型除外)。
  • 模型权重需单独下载。

商业合作邮箱:indexspeech@bilibili.com

部署体验

部署门槛不低:需要 GPU、CUDA 12.8+、uv,还要手动下载权重。但一旦环境配好,WebUI 使用很简单。命令如下:

```bash git clone https://github.com/index-tts/index-tts.git cd index-tts uv sync --all-extras # 下载 IndexTTS-2 权重并放到正确位置 uv run webui.py ```

之后访问 http://127.0.0.1:7860 即可。

能力边界

当前版本最大的遗憾是‘精确时长控制’没有真正启用,所以无法直接做精确对口型。另外,随机采样会伤害克隆相似度,生产使用时需要固定种子或做取舍。如果你需要的是高质量、情感丰富、多语言的语音生成,它非常强;如果你需要精细到音素级别的时长编辑,请等待后续 release 或选择其他工具。

类似项目

  • **Coqui TTS**:老牌 TTS 工具包,XTTS v2 支持 16+ 语言零样本克隆,Apache 许可证,但维护已停滞。
  • **Tortoise TTS**:高保真英文 TTS,Apache 2.0,推理慢,缺少情感/时长控制。
  • **Confucius4-TTS**:网易有道的 LLM TTS,支持 14 语言和情绪迁移,许可证友好。
  • **Step-Audio-EditX**:3B 参数音频编辑模型,支持情感/风格控制,Apache 2.0,但资源占用高。

结论

IndexTTS2 是当前零样本 TTS 领域的头部选手,能力出色,但许可证和部署门槛限制了它的普适性。如果你有 GPU 资源和合规需求,它能成为内容生成链路中的利器;如果你是大公司或想要无限制商用,可能需要考虑替代方案或联系 B 站单独授权。

查看仓库原址

An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System

查看 GitHub

图解与配图

这篇文章暂时还没有配图。

替代项目

如果你已经准备落地,优先比较这些替代项目的部署和商用条件。

coqui-ai/TTS

A comprehensive deep learning toolkit for Text-to-Speech, featuring XTTS v2 for zero-shot voice cloning in 16+ languages, plus training and fine-tuning utilities.

部署难度7/10
商业可用性7/10
能力上限7/10

优势

Mature and widely adopted; easy PyPI installation with Docker support; broad language coverage; many pretrained models and vocoders.

劣势

Project appears unmaintained (last push 2024); less precise emotional and duration control; XTTS v2 quality may trail newer specialized models.

结论

A solid, permissively-licensed general-purpose TTS library, but less advanced for expressive or duration-controlled synthesis and showing signs of stagnation.

coqui-ai/TTS

neonbjb/tortoise-tts

A high-quality multi-voice TTS system prioritizing realistic prosody, using an autoregressive and diffusion architecture; supports voice cloning from reference clips.

部署难度5/10
商业可用性9/10
能力上限6/10

优势

Excellent speech quality and prosody; Apache 2.0 license; well-known and influential; active community despite age.

劣势

Slow inference; primarily English-only; lacks fine emotion or duration control; setup can be tricky on Windows.

结论

A respected choice for high-fidelity English TTS with a truly open license, but it lags behind in multilingual support and expressive control.

neonbjb/tortoise-tts

netease-youdao/Confucius4-TTS

An LLM-based multilingual zero-shot TTS engine supporting 14 languages with cross-lingual voice transfer, emotion cloning, and unconstrained voice cloning.

部署难度7/10
商业可用性8/10
能力上限8/10

优势

Broad multilingual and cross-lingual support; emotion transfer; zero-shot cloning; includes WebUI, FastAPI server, and fine-tuning scripts.

劣势

Metadata license ambiguity (NOASSERTION despite Apache text); newer project with smaller community; no duration control.

结论

A compelling modern alternative with excellent language coverage and a permissive license, ideal for multilingual commercial deployments.

netease-youdao/Confucius4-TTS

stepfun-ai/Step-Audio-EditX

A 3B-parameter LLM-based audio editing model that also performs zero-shot TTS, with fine-grained control over emotion, speaking style, and paralinguistics.

部署难度6/10
商业可用性8/10
能力上限8/10

优势

Unique iterative audio editing; precise emotion/style/paralinguistic control; good zero-shot TTS for Chinese, English, etc.; Apache 2.0.

劣势

Higher GPU memory (12GB+); fewer languages than some alternatives; focus on editing rather than pure TTS; newer project.

结论

A state-of-the-art option for expressive and editable audio, but it demands more resources and has narrower language coverage than Confucius4-TTS or Coqui.

stepfun-ai/Step-Audio-EditX