متن به گفتار (Text to Speech)
متن فارسی یا انگلیسی را با گویندگان فارسیزبان به صدا تبدیل کنید؛ تکگوینده یا دیالوگ چندنفره با تگهای حسی. فایل صوتی همان لحظه برمیگردد.
مسیر درخواست
https://bananaai.ir/api/v1/audio/speechبرخلاف عکس و ویدیو، این مسیر همگام است: درخواست تا ساخته شدن صدا باز میماند (معمولاً چند ثانیه) و پاسخ مستقیماً نشانی فایل MP3 را دارد. تسک ساختهشده هم با وضعیت completed در فهرست تسکها ثبت میشود.
پارامترهای درخواست
بدنهٔ درخواست باید JSON باشد. یکی از text (تکگوینده) یا turns (دیالوگ) را بفرستید.
textstringاختیاری- متنی که خوانده میشود؛ حداکثر ۲٬۵۰۰ کاراکتر. برای جهتدادن به لحن، تگهای صوتی انگلیسی داخل [ ] بگذارید؛ مثل [happily]، [whispers] یا [calmly].
- مثال:
[excitedly] سلام! به بنانا خوش آمدید. voice_idstringاختیاری- شناسهٔ گوینده. فهرست کامل در گویندگان و در
GET /api/v1/models?type=audio. - پیشفرض:
rNb3hdSf0n4ROIbYC8Bl turnsobject[]اختیاری- برای دیالوگ: آرایهای از {text, voice_id}؛ ۲ تا ۲۰ نوبت، حداکثر ۱۰ گوینده و ۲٬۰۰۰ کاراکتر در مجموع. اگر turns بفرستید text و voice_id نادیده گرفته میشوند.
stabilitynumberاختیاری- ۰ بیانگر (بیشترین حس)، ۰٫۵ طبیعی، ۱ ثابت و یکدست. اگر متن تگ صوتی داشته باشد خودکار ۰ میشود تا تگها اثر کنند.
- پیشفرض:
0.5مقادیر مجاز:00.51 metadataobjectاختیاری- جفتهای کلید/مقدار دلخواه (تا ۱۶ کلید، مقدار حداکثر ۵۰۰ کاراکتر) مثل شناسهٔ سفارش شما. در پاسخ تسک و بدنهٔ وبهوک عیناً برمیگردد تا نتیجه را به رکورد خودتان وصل کنید.
- مثال:
{"order_id":"1042"}
هزینه
گویندگان
همهٔ گویندگان لهجهٔ فارسی تهرانی دارند و برای متن فارسی بهترین نتیجه را میدهند.
نمونه درخواست
دیالوگ چندنفره
برای گفتگوی چند گوینده، بهجای text آرایهٔ turns را بفرستید. خروجی یک فایل صوتی واحد است که نوبتها پشت سر هم و با صدای هر گوینده خوانده میشوند:
پاسخ
نشانی فایل در audio_url (و همان مقدار در audios) است. اگر ساخت صدا ناموفق شود، 500 با کد generation_failed برمیگردد و اعتباری کسر نمیشود.