گفتار به متن (Speech to Text)
فایل صوتی یا ویدیویی را به متن تبدیل کنید؛ با تشخیص خودکار زبان، زمانبندی هر کلمه و تفکیک گوینده. متن همان لحظه برمیگردد.
نسخهٔ API: v1
مسیر درخواست
POST
https://bananaai.ir/api/v1/audio/transcriptionsنشانی یک فایل صوتی یا ویدیویی را بفرستید و متن آن را در همان پاسخ بگیرید. این مسیر همگام است و بسته به طول فایل چند ثانیه تا حدود یک دقیقه طول میکشد؛ مهلت کلاینت HTTP خود را دستکم ۱۲۰ ثانیه بگذارید.
پارامترهای درخواست
بدنهٔ درخواست باید JSON باشد (Content-Type: application/json).
audio_urlstringالزامی- نشانی عمومی https فایل. MP3، WAV، AAC، M4A، OGG، WEBM یا MP4؛ حداکثر ۵ دقیقه و ۱۰۰ مگابایت.
- مثال:
https://example.com/interview.mp3 languagestringاختیاری- زبان گفتار (ISO-639-1). اگر مطمئن نیستید auto بگذارید تا خودکار تشخیص داده شود.
- پیشفرض:
autoمقادیر مجاز:autofaenartrdefresitptrujakozhhinlplsviduk diarizebooleanاختیاری- تفکیک گویندهها. اگر true باشد هر خط متن با شناسهٔ گوینده شروع میشود (speaker_0: …) و هر کلمه speaker_id دارد.
- پیشفرض:
false tag_audio_eventsbooleanاختیاری- رویدادهای غیرگفتاری مثل (خنده) یا (تشویق) را هم در متن علامت بزند.
- پیشفرض:
true metadataobjectاختیاری- جفتهای کلید/مقدار دلخواه (تا ۱۶ کلید، مقدار حداکثر ۵۰۰ کاراکتر) مثل شناسهٔ سفارش شما. در پاسخ تسک و بدنهٔ وبهوک عیناً برمیگردد تا نتیجه را به رکورد خودتان وصل کنید.
- مثال:
{"order_id":"1042"}
هزینه
به ازای هر دقیقهٔ فایل (رو به بالا، حداقل ۱ دقیقه). مدت فایل را خودمان پس از دانلود اندازه میگیریم؛ جزئیات در اعتبار و هزینه.
دسترسی به فایل
فایل باید بدون ورود و مستقیماً قابل دانلود باشد. اگر دانلود نشود یا صدایی نداشته باشد،
400 با کد invalid_source برمیگردد و اعتباری کسر نمیشود.نمونه درخواست
bash
پاسخ
JSON
textstring- متن کامل.
transcript_urlstring- همان متن بهصورت فایل txt برای دانلود.
languagestring- زبان تشخیصدادهشده یا ارسالی.
wordsobject[]- کلمهها با زمان شروع و پایان (ثانیه) برای ساخت زیرنویس؛ type یکی از word، spacing یا audio_event است.
audiosstring[]- نسخهٔ ذخیرهشدهٔ فایل ورودی شما.