یک مدرس دورهٔ آنلاین، متن یک ویدیوی ۴۰ ثانیهای را آماده کرده، اما نه استودیو دارد و نه گوینده. صاحب یک فروشگاه هم برای معرفی محصول تازهاش نریشن تمیز میخواهد، بیآنکه هر بار ضبط را از اول شروع کند. تبدیل متن به گفتار فارسی دقیقاً برای همین کارها به درد میخورد: متن را مینویسید، صدا را میسازید، بعد اگر لازم بود متن را کمی اصلاح میکنید و دوباره خروجی میگیرید.
این راهنما نشان میدهد چه استفادههایی منطقیاند، در گیسو کدام مدلها را انتخاب کنید، متن فارسی را چطور آماده کنید تا کمتر بد خوانده شود، و اگر توسعهدهنده هستید چطور از API خروجی صوتی بگیرید.
تبدیل متن به گفتار فارسی دقیقاً به چه کار شما میآید
تبدیل متن به گفتار (Text to Speech) برای متنهایی مناسب است که لحن ثابت، تلفظ قابل پیشبینی و ویرایش سریع میخواهند. برای ریلز، آموزش کوتاه، معرفی محصول، پیام خوشامدگویی داخل سایت یا اپلیکیشن و نسخهٔ صوتی مقالههای کوتاه، معمولاً نتیجهٔ قابل استفاده میگیرید.
برای نمونه، اگر ویدیوی آموزشی میسازید، میتوانید صدای هر بخش را جدا بسازید: «تعریف مسئله»، «نمایش صفحه»، «دعوت به تمرین». اگر پادکست کوتاه تولید میکنید، نسخهٔ آزمایشی متن را با صدا میشنوید و جای جملههای سنگین را پیدا میکنید. اگر توسعهدهنده هستید، پیامهایی مثل «سفارش شما ثبت شد» یا «برای ادامه، کد پیامکشده را وارد کنید» را بدون ضبط دستی به فایل صوتی تبدیل میکنید.
برای تمرین تلفظ هم کاربرد دارد. زبانآموز یا مدرس میتواند چند جملهٔ فارسی را با سرعت پایینتر بسازد و روی مکثها تمرین کند. با این حال، باید واقعبین باشید: مدلها فارسی را میخوانند، اما ممکن است بعضی واژههای چندمعنا یا اسمهای خاص را اشتباه تلفظ کنند. پیش از ساخت نریشن کامل، یک نمونهٔ کوتاه از همان متن را امتحان کنید.
نمونهٔ قابل کپی برای شروع: متن نریشن را در سه بند کوتاه بنویسید، هر بند را جدا بسازید، بعد به ویدیو اضافه کنید. اصلاح یک بند ۱۰ ثانیهای بسیار سادهتر از اصلاح یک فایل بلند است.
مدلها را بر اساس شفافیت صدا، کنترل لحن و هزینه انتخاب کنید
در گیسو برای تبدیل متن به صدا با هوش مصنوعی، چند مدل متنی-گفتاری دارید. مدل tts-1 گزینهٔ اقتصادیتر است و برای پیامهای کوتاه، نمونهگیری سریع و محتوای داخلی خوب جواب میدهد. مدل tts-1-hd صدای شفافتری میسازد و وقتی فایل قرار است روی ویدیو یا درس منتشر شود، انتخاب بهتری است.
مدل gpt-4o-mini-tts یک مزیت مهم دارد: میتوانید برای لحن، دستور بدهید. مثلاً بنویسید «گرم و آرام، با مکث کوتاه بین جملهها» یا «رسمی، شمرده و مناسب آموزش». این دستورها معجزه نمیکنند، اما مسیر خواندن را روشنتر میکنند.
برای tts-1 و tts-1-hd صداهای alloy، echo، fable، onyx، nova و shimmer در دسترساند. سرعت خواندن از 0.25 تا 4 تنظیم میشود و 1 سرعت عادی است. خروجی را میتوانید در قالبهای mp3، opus، aac یا wav بگیرید.
| نیاز شما | انتخاب پیشنهادی | نکتهٔ عملی |
|---|---|---|
| نمونهٔ سریع برای شنیدن متن | tts-1 | یک بند کوتاه بسازید و تلفظ واژههای حساس را بررسی کنید. |
| نریشن آموزشی یا ریلز | tts-1-hd | جملهها را کوتاه نگه دارید تا مکثها طبیعیتر شوند. |
| پیام برند یا اپلیکیشن با لحن مشخص | gpt-4o-mini-tts | در بخش دستور لحن، دقیق بنویسید: «آرام»، «صمیمی»، «رسمی» یا «انرژیدار». |
در گیسو از متن به گفتار خروجی بگیرید
برای ساخت نریشن با هوش مصنوعی در محیط گرافیکی، صفحهٔ تولید محتوا در گیسو را باز کنید و ابزار «متن به گفتار» را انتخاب کنید. معرفی کامل ابزارهای صوتی گیسو هم در صفحهٔ صدا و گفتار آمده است.
- متن را بچسبانید. متن نهایی یا نسخهٔ آزمایشی را وارد کنید. هر درخواست تا ۴٬۰۹۶ نویسه میپذیرد، پس متنهای بلند را از ابتدا بخشبندی کنید.
- سطح را انتخاب کنید. بین «اقتصادی» و «کیفیت بالا» انتخاب کنید. برای پیام داخلی، سطح اقتصادی کافی است؛ برای نریشن منتشرشده، کیفیت بالاتر را امتحان کنید.
- صدا و سرعت را تنظیم کنید. در «تنظیمات بیشتر» یک صدا انتخاب کنید و سرعت را روی عدد نزدیک به
1بگذارید. برای آموزش، کمی آهستهتر از حالت عادی معمولاً بهتر شنیده میشود. - هزینهٔ تقریبی را ببینید. قبل از اجرا، کنار دکمهٔ ساخت، برآورد هزینه نشان داده میشود. هزینه بر اساس تعداد نویسههای متن محاسبه میشود.
- خروجی را بسازید و دریافت کنید. بعد از ساخت، فایل را گوش کنید و اگر تلفظ یا مکثها مناسب نبود، متن را اصلاح کنید.
- فایل را از آرشیو بردارید. نتیجهها در آرشیو آثار میمانند و میتوانید آنها را دریافت، حذف یا دوبارهسازی کنید.
تصویر هر تصویر مربع ۱۰۲۴ در ۱۰۲۴
- اقتصادی GPT Image 1 mini، کیفیت پایین ۹۱۳ سکه
- متعادل GPT Image 1 mini، کیفیت متوسط ۳,۱۷۷ سکه
- حرفهای Nano Banana 2 (Gemini 3.1 Flash Image)، کیفیت 2K ۴۲,۹۲۰ سکه
- بالاترین کیفیت Nano Banana Pro (Gemini 3 Pro Image)، کیفیت 2K ۶۱,۶۲۶ سکه
ویدیو با صدا هر کلیپ، با مدت همان ردیف
- اقتصادی Veo 3.1 Lite، ۴ ثانیه ۷۲,۲۱۲ سکه
- متعادل Veo 3.1 Fast، ۸ ثانیه ۲۸۸,۸۴۸ سکه
- حرفهای Veo 3.1، ۸ ثانیه ۱,۱۵۵,۳۹۲ سکه
- بالاترین کیفیت Veo 3.1، ۸ ثانیه ۱,۱۵۵,۳۹۲ سکه
موسیقی هر قطعه
- کلیپ کوتاه Lyria 3 Clip ۱۴,۴۴۳ سکه
- قطعهٔ کامل Lyria 3.5 ۲۸,۸۸۵ سکه
متن به گفتار هر ۱۰۰۰ نویسهٔ متن (حدود ۱۸۰ کلمهٔ فارسی)
- اقتصادی Gemini 3.8 Flash-Lite TTS ۵,۴۸۹ سکه
- کیفیت بالا Gemini 3.8 Flash TTS ۸,۱۹۷ سکه
گفتار به متن هر دقیقه صدا
- GPT Transcribe ۱,۶۲۵ سکه
- Whisper v1 ۲,۱۶۷ سکه
ردیفها همان سطحهای «بودجه و کیفیت» صفحهٔ تولید محتوا در گیسو هستند. پیش از ساخت، هزینهٔ تقریبی کنار دکمهٔ ساخت میآید و مبلغ دقیق بعد از ساخت روی کارت نتیجه ثبت میشود.
اگر ویدیو ساخته نشود، کل هزینهاش خودکار به اعتبار برمیگردد.
بهروزرسانی: ۱۴۰۵/۰۷/۰۹ ۰۴:۲۴ مبلغها به سکه، با قیمت امروز همان مدل در گیسو
اگر برای یک ویدیو به صدا، موسیقی و تصویر نیاز دارید، بهتر است صدا را جدا بسازید و روی تدوین کنترل داشته باشید. برای موسیقی پسزمینه میتوانید راهنمای ساخت موسیقی با هوش مصنوعی را بخوانید و برای پرامپت ویدیو هم راهنمای پرامپت ویدیو با Sora کمک میکند.
متن فارسی را طوری آماده کنید که درستتر خوانده شود
کیفیت TTS فارسی فقط به مدل بستگی ندارد. متن فارسی اگر بینشانه، طولانی و پر از اسم خارجی نوشته شود، حتی مدل خوب هم گاهی بد میخواند. قبل از ساخت فایل نهایی، متن را مثل متنی آماده کنید که قرار است یک گوینده آن را بخواند.
واژههای چندمعنا را با حرکتگذاری روشن کنید
در فارسی، بعضی کلمهها بدون حرکتگذاری چند جور خوانده میشوند. اگر معنی برای متن مهم است، همان چند واژه را علامتگذاری کنید. لازم نیست کل متن را اعرابگذاری کنید؛ فقط جاهای مبهم را اصلاح کنید.
| قبل | بعد |
|---|---|
| او کرد است. | او کُرد است. |
| این مهر برای بستهبندی است. | این مُهر برای بستهبندی است. |
| مهر امسال دوره شروع میشود. | مِهر امسال دوره شروع میشود. |
عددها را همانطور بنویسید که باید شنیده شوند
مدلها معمولاً عدد را میخوانند، اما برای نریشن بهتر است ابهام را کم کنید. مخصوصاً وقتی عدد، تاریخ، شمارهٔ نسخه یا زمان است، شکل گفتاری را بنویسید.
| قبل | بعد |
|---|---|
| ارسال از ۱۴۰۳/۰۷/۱۲ شروع میشود. | ارسال از دوازدهم مهر ۱۴۰۳ شروع میشود. |
| ویدیو 40 ثانیه است. | ویدیو چهل ثانیه است. |
| نسخه 2.1 منتشر شد. | نسخهٔ دو ممیز یک منتشر شد. |
مکثها را با نشانهگذاری بسازید
ویرگول، نقطه و شکست بند روی مکث اثر میگذارند. اگر همهٔ متن را در یک پاراگراف بلند بگذارید، صدا نفس مصنوعی و ریتم یکنواخت پیدا میکند. جملههای کوتاهتر، خروجی را قابل تدوینتر میکنند.
در این ویدیو یاد میگیرید چطور صفحه محصول را بهتر بنویسید ابتدا عنوان را اصلاح میکنیم بعد توضیح کوتاه مینویسیم و در پایان دعوت به خرید را اضافه میکنیم
بعد:
در این ویدیو یاد میگیرید چطور صفحهٔ محصول را بهتر بنویسید.
ابتدا عنوان را اصلاح میکنیم.
بعد توضیح کوتاه مینویسیم.
در پایان، دعوت به خرید را اضافه میکنیم.
اسمهای خارجی را با حروف فارسی بنویسید
اگر نام انگلیسی را همانطور رها کنید، مدل ممکن است آن را با تلفظ نامناسب بخواند. در متن نریشن، تلفظ را فارسی کنید. مثلاً به جای Canva بنویسید «کَنوا» یا اگر تلفظ رایج دیگری در مخاطبان شما جا افتاده، همان را بنویسید.
نیمفاصلهها را هم اصلاح کنید: «می شود» را به «میشود» تبدیل کنید، «صفحه محصول» را اگر نقش اضافه دارد «صفحهٔ محصول» بنویسید، و عبارتهایی مثل «دوباره سازی» را به «دوبارهسازی» تغییر دهید. این کار هم خواندن را بهتر میکند و هم متن نهایی را برای آرشیو مرتب نگه میدارد.
متنهای بلند را بخشبندی کنید و بعد به هم بچسبانید
هر درخواست متن به گفتار تا ۴٬۰۹۶ نویسه میپذیرد. برای مقالهٔ صوتی، درس بلند یا فصل کوتاه، متن را از مرز پاراگرافها جدا کنید. هر بخش باید با یک جملهٔ کامل تمام شود؛ وسط جمله برش نزنید، چون اتصال فایلها گوش را اذیت میکند.
یک روش عملی این است: متن را به بخشهای ۶۰ تا ۹۰ ثانیهای تقسیم کنید، نام فایلها را مرتب بگذارید و بعد با ffmpeg آنها را یکی کنید. اگر خروجیها همقالب باشند، دستور اتصال بدون تبدیل دوباره کار میکند.
printf "file 'part1.mp3'\nfile 'part2.mp3'\nfile 'part3.mp3'\n" > list.txt
ffmpeg -f concat -safe 0 -i list.txt -c copy full.mp3اگر بین بخشها اختلاف بلندی صدا شنیدید، به جای اتصال مستقیم، در نرمافزار تدوین صدا یا ویدیو سطح صدا را یکسان کنید. برای نریشن درس، چند ثانیه سکوت در ابتدا و انتهای فایل را هم دستی تنظیم کنید.
توسعهدهندگان میتوانند با API فایل صوتی بسازند
برای اپلیکیشن، داشبورد آموزشی یا سامانهٔ پشتیبانی، وبسرویس برنامهنویسی (API) گیسو با قالب کتابخانهٔ رسمی OpenAI کار میکند. نشانی پایه https://gisoo.pro/api/v1 است و کلید را باید در متغیر محیطی GISOO_API_KEY نگه دارید. کلید را در کد فرانتاند یا اپ موبایل نگذارید.
نمونهٔ پایتون زیر با gpt-4o-mini-tts صدای nova میسازد و برای لحن، دستور فارسی میدهد.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["GISOO_API_KEY"],
base_url="https://gisoo.pro/api/v1",
)
text = "سلام. به پنل آموزش خوش آمدید. از منوی سمت راست، درس بعدی را انتخاب کنید."
speech = client.audio.speech.create(
model="gpt-4o-mini-tts",
voice="nova",
input=text,
instructions="گرم و آرام، با مکث کوتاه بین جملهها",
)
speech.write_to_file("welcome.mp3")نمونهٔ Node.js زیر از tts-1 استفاده میکند و فایل intro.mp3 را روی سرور مینویسد.
import OpenAI from "openai";
import { writeFile } from "node:fs/promises";
const client = new OpenAI({
apiKey: process.env.GISOO_API_KEY,
baseURL: "https://gisoo.pro/api/v1",
});
const speech = await client.audio.speech.create({
model: "tts-1",
voice: "alloy",
input: "برای ادامه، گزینهٔ ساخت حساب را انتخاب کنید.",
});
const buffer = Buffer.from(await speech.arrayBuffer());
await writeFile("intro.mp3", buffer);جزئیات پارامترها، قالبهای خروجی و مسیرهای صوتی را در مستندات صوتی API ببینید. برای مسیر برعکس، یعنی تبدیل گفتار به متن، گیسو مدلهای whisper-1 و gpt-4o-transcribe را هم دارد، اما آن موضوع نیاز به راهنمای جداگانه دارد.
شفافیت و حقوق استفاده را از ابتدا جدی بگیرید
سیاست استفادهٔ OpenAI میگوید به شنوندگان اطلاع بدهید که صدا با هوش مصنوعی ساخته شده است. این جمله میتواند کوتاه باشد: «این صدا با هوش مصنوعی تولید شده است.» برای محتوای آموزشی، تبلیغاتی یا پیام داخل اپ، همین شفافیت ساده جلوی سوءبرداشت را میگیرد.
از مدلها برای تقلید صدای شخص واقعی، گویندهٔ شناختهشده یا هنرمند مشخص استفاده نکنید. اگر خروجی را در پروژهٔ تجاری منتشر میکنید، شرایط ارائهدهندهٔ مدل را هم بررسی کنید. گیسو دربارهٔ استفادهٔ تجاری از این خروجیها قرارداد جداگانهای ندارد؛ شرایط خود ارائهدهنده ملاک است.
برای شروع، یک متن ۳ تا ۵ جملهای از کار واقعی خودتان بردارید. واژههای مبهم را روشن کنید، سرعت را نزدیک حالت عادی بگذارید و یک خروجی کوتاه بسازید. اگر همان نمونه خوب شنیده شد، متن کامل را بخشبندی کنید و سراغ نسخهٔ نهایی بروید.