{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13295/cloud+based+multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27510/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13295/cloud+based+multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27511/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
注册后,每个开发者都会被分配一个个人 API 访问密钥,这是一个唯一的字母和数字组合,用于访问我们的 API 端点。要使用 云基于多语言文本到语音TTS和语音到文本STT API 进行身份验证,只需在 Authorization 标头中包含您的 bearer token。
| 标头 | 描述 |
|---|---|
授权
|
必需
应为 Bearer access_key. 订阅后,请查看上方的"您的 API 访问密钥"。
|
文本转语音(TTS)端点返回从输入文本合成的高保真WAV音频文件,而语音转文本(STT)端点返回上传音频文件的逐字转录文本格式
对于TTS,关键字段是“音频”,它包含音频数据。对于STT,关键字段包括“文本”(转录文本),“提供者”(使用的服务),“模型”(使用的具体模型),“时长秒数”(音频长度)和“处理的音频段数”(处理的音频段数量)
TTS端点接受参数如“文本”(输入文本)“语言”(合成所需的语言)和“声音”(特定的声音模型)STT端点接受参数如“音频文件”(要转录的音频)和“语言”(音频的语言)
TTS响应包含一个字段“audio”用于合成的音频数据 STT响应结构包含多个字段:“text”用于转录 “provider”用于所使用的服务 “model”用于转录模型 “durationSecs”用于音频长度 “chunksProcessed”用于处理的段数
TTS和STT功能由Google Gemini和OpenAI ChatGPT的先进技术提供支持,确保高质量的音频合成和转录准确性
典型的用例包括使用TTS为视频创建旁白 生成有声书 以及使用STT转录会议或访谈以便于文档记录和可及性
用户可以直接在应用程序中播放TTS端点返回的音频或将其保存为文件。对于STT,转录的文本可以用于文档编制、分析或在聊天机器人或内容创作等应用中进一步处理
数据准确性通过使用谷歌和OpenAI的先进神经模型得以保持,这些模型不断训练和更新以提高性能并适应各种语言和口音