文本转语音
零样本音色克隆、情绪驱动与中英混读。把文字变成有表情、有呼吸感的声音。
零样本音色克隆、情绪驱动与中英混读。把文字变成有表情、有呼吸感的声音。
从一张肖像与一段音频,生成稳定自然的数字人口播,支持 480p 与 720p。
一次请求串联语音与人像生成,省去中间文件编排,适合批量内容生产。
curl -X POST https://ybstudio.cn/api/v1/tts \
-H "X-API-Key: yb_••••" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: project-42" \
-d '{"text":"让声音被看见"}'
202 Accepted
{
"id": "job_••••",
"status": "queued",
"reserved_credits": 12.5
}