语音合成(TTS)
把文本转成自然人声。按输入文本的 UTF-8 字符数计费 ¥0.05/千字符(1 个汉字算 1 字符)。
POST /v1/audio/speech
模型:CosyVoice2-0.5B(中英日韩+方言,低延迟)、MOSS-TTSD-v0.5(双人对话/播客,支持声音克隆)。
voice 字段格式为 模型名:音色,内置音色无需预注册,例如 FunAudioLLM/CosyVoice2-0.5B:alex。
curl https://https://api.0ki.cn/v1/audio/speech ^
-H "Authorization: Bearer 你的API密钥" ^
-H "Content-Type: application/json" ^
-d "{ \"model\": \"CosyVoice2-0.5B\", \"input\": \"你好,这是语音合成测试。\", \"voice\": \"FunAudioLLM/CosyVoice2-0.5B:alex\", \"response_format\": \"mp3\" }" ^
-o audio.mp3
响应是二进制音频(mp3/wav/pcm),不是 JSON,请直接保存到文件。CosyVoice2 内置音色:alex/benjamin/charles/daniel(男)、anna/bella/claire/diana(女)。