Skip to content

TTS 与音频

Readori 将系统语音、HTTP TTS、离线神经网络语音和 LibriVox 统一路由到阅读器控制面板。

引擎类型

内置引擎并不是笼统的“系统 / HTTP”两分类,实际是 5 个内置 provider(对应 TTSProviderType),外加两条独立的音频来源:

Provider特点
system 系统语音AVSpeechSynthesizer,完全离线,零配置
edgeTTS 微软 Edge 朗读免费在线,不需要 Key;协议是逆向工程得到的 WebSocket 握手(speech.platform.bing.com),不是官方公开 API,微软调整握手细节时可能失效
googleTTS Google 翻译朗读免费在线,不需要 Key;单次请求约 190–200 字符上限,超长文本自动分段拼接;非官方接口,请求过于频繁可能被限流
baiduTTS 百度语音合成官方公开 REST API,需要用户自行申请 API Key/Secret Key;先用 Key 换 access_token(约 30 天有效,本地缓存自动续期),再调用 text2audio;单次合成约 500 字符上限;有每日免费额度
custom 自定义 HTTP 引擎用户自己配置 URL/headers/body 模板,兼容 MultiTTS 风格清单,见HTTP TTS

edgeTTS/googleTTS 是"免费但非官方"的逆向接口,作为主力长期高频朗读不如系统语音稳定; baiduTTS 是唯一"官方文档 + 需要凭据"的内置引擎。三者都不需要用户手写 URL 模板——这一点 是它们和下面的 custom/HTTP TTS 最大的区别,custom 才是"用户自己描述协议"的那一档。

离线神经网络(sherpa-onnx 本地推理)和 LibriVox(有声书流媒体)不在 TTSProviderType 枚举里,是两条独立的音频路径,分别见离线神经网络 TTSLibriVox

阅读联动

朗读按句子推进、高亮当前句、自动进入下一页/章。停止、切换引擎、跳句或重启配置会取消 旧请求,过期 callback 不得安装播放器或继续播放旧音频。

Readori 使用与开发文档