پرش به محتوا
آموزش

تبدیل متن فارسی به گفتار با هوش مصنوعی؛ نریشن ویدیو، پیام صوتی و محتوای آموزشی

متن فارسی را طوری آماده کنید که درست خوانده شود، مدل و صدای مناسب را انتخاب کنید و نریشن ویدیو یا پیام صوتی بسازید؛ با نمونه‌کد Python و Node.js.

تیم گیسو ۱۱ دقیقه مطالعه
تبدیل متن فارسی به گفتار با هوش مصنوعی؛ نریشن ویدیو، پیام صوتی و محتوای آموزشی

یک مدرس دورهٔ آنلاین، متن یک ویدیوی ۴۰ ثانیه‌ای را آماده کرده، اما نه استودیو دارد و نه گوینده. صاحب یک فروشگاه هم برای معرفی محصول تازه‌اش نریشن تمیز می‌خواهد، بی‌آنکه هر بار ضبط را از اول شروع کند. تبدیل متن به گفتار فارسی دقیقاً برای همین کارها به درد می‌خورد: متن را می‌نویسید، صدا را می‌سازید، بعد اگر لازم بود متن را کمی اصلاح می‌کنید و دوباره خروجی می‌گیرید.

این راهنما نشان می‌دهد چه استفاده‌هایی منطقی‌اند، در گیسو کدام مدل‌ها را انتخاب کنید، متن فارسی را چطور آماده کنید تا کمتر بد خوانده شود، و اگر توسعه‌دهنده هستید چطور از API خروجی صوتی بگیرید.

تبدیل متن به گفتار فارسی دقیقاً به چه کار شما می‌آید

تبدیل متن به گفتار (Text to Speech) برای متن‌هایی مناسب است که لحن ثابت، تلفظ قابل پیش‌بینی و ویرایش سریع می‌خواهند. برای ریلز، آموزش کوتاه، معرفی محصول، پیام خوشامدگویی داخل سایت یا اپلیکیشن و نسخهٔ صوتی مقاله‌های کوتاه، معمولاً نتیجهٔ قابل استفاده می‌گیرید.

برای نمونه، اگر ویدیوی آموزشی می‌سازید، می‌توانید صدای هر بخش را جدا بسازید: «تعریف مسئله»، «نمایش صفحه»، «دعوت به تمرین». اگر پادکست کوتاه تولید می‌کنید، نسخهٔ آزمایشی متن را با صدا می‌شنوید و جای جمله‌های سنگین را پیدا می‌کنید. اگر توسعه‌دهنده هستید، پیام‌هایی مثل «سفارش شما ثبت شد» یا «برای ادامه، کد پیامک‌شده را وارد کنید» را بدون ضبط دستی به فایل صوتی تبدیل می‌کنید.

برای تمرین تلفظ هم کاربرد دارد. زبان‌آموز یا مدرس می‌تواند چند جملهٔ فارسی را با سرعت پایین‌تر بسازد و روی مکث‌ها تمرین کند. با این حال، باید واقع‌بین باشید: مدل‌ها فارسی را می‌خوانند، اما ممکن است بعضی واژه‌های چندمعنا یا اسم‌های خاص را اشتباه تلفظ کنند. پیش از ساخت نریشن کامل، یک نمونهٔ کوتاه از همان متن را امتحان کنید.

نمونهٔ قابل کپی برای شروع: متن نریشن را در سه بند کوتاه بنویسید، هر بند را جدا بسازید، بعد به ویدیو اضافه کنید. اصلاح یک بند ۱۰ ثانیه‌ای بسیار ساده‌تر از اصلاح یک فایل بلند است.

مدل‌ها را بر اساس شفافیت صدا، کنترل لحن و هزینه انتخاب کنید

در گیسو برای تبدیل متن به صدا با هوش مصنوعی، چند مدل متنی-گفتاری دارید. مدل tts-1 گزینهٔ اقتصادی‌تر است و برای پیام‌های کوتاه، نمونه‌گیری سریع و محتوای داخلی خوب جواب می‌دهد. مدل tts-1-hd صدای شفاف‌تری می‌سازد و وقتی فایل قرار است روی ویدیو یا درس منتشر شود، انتخاب بهتری است.

مدل gpt-4o-mini-tts یک مزیت مهم دارد: می‌توانید برای لحن، دستور بدهید. مثلاً بنویسید «گرم و آرام، با مکث کوتاه بین جمله‌ها» یا «رسمی، شمرده و مناسب آموزش». این دستورها معجزه نمی‌کنند، اما مسیر خواندن را روشن‌تر می‌کنند.

برای tts-1 و tts-1-hd صداهای alloy، echo، fable، onyx، nova و shimmer در دسترس‌اند. سرعت خواندن از 0.25 تا 4 تنظیم می‌شود و 1 سرعت عادی است. خروجی را می‌توانید در قالب‌های mp3، opus، aac یا wav بگیرید.

نیاز شماانتخاب پیشنهادینکتهٔ عملی
نمونهٔ سریع برای شنیدن متنtts-1یک بند کوتاه بسازید و تلفظ واژه‌های حساس را بررسی کنید.
نریشن آموزشی یا ریلزtts-1-hdجمله‌ها را کوتاه نگه دارید تا مکث‌ها طبیعی‌تر شوند.
پیام برند یا اپلیکیشن با لحن مشخصgpt-4o-mini-ttsدر بخش دستور لحن، دقیق بنویسید: «آرام»، «صمیمی»، «رسمی» یا «انرژی‌دار».

در گیسو از متن به گفتار خروجی بگیرید

برای ساخت نریشن با هوش مصنوعی در محیط گرافیکی، صفحهٔ تولید محتوا در گیسو را باز کنید و ابزار «متن به گفتار» را انتخاب کنید. معرفی کامل ابزارهای صوتی گیسو هم در صفحهٔ صدا و گفتار آمده است.

  1. متن را بچسبانید. متن نهایی یا نسخهٔ آزمایشی را وارد کنید. هر درخواست تا ۴٬۰۹۶ نویسه می‌پذیرد، پس متن‌های بلند را از ابتدا بخش‌بندی کنید.
  2. سطح را انتخاب کنید. بین «اقتصادی» و «کیفیت بالا» انتخاب کنید. برای پیام داخلی، سطح اقتصادی کافی است؛ برای نریشن منتشرشده، کیفیت بالاتر را امتحان کنید.
  3. صدا و سرعت را تنظیم کنید. در «تنظیمات بیشتر» یک صدا انتخاب کنید و سرعت را روی عدد نزدیک به 1 بگذارید. برای آموزش، کمی آهسته‌تر از حالت عادی معمولاً بهتر شنیده می‌شود.
  4. هزینهٔ تقریبی را ببینید. قبل از اجرا، کنار دکمهٔ ساخت، برآورد هزینه نشان داده می‌شود. هزینه بر اساس تعداد نویسه‌های متن محاسبه می‌شود.
  5. خروجی را بسازید و دریافت کنید. بعد از ساخت، فایل را گوش کنید و اگر تلفظ یا مکث‌ها مناسب نبود، متن را اصلاح کنید.
  6. فایل را از آرشیو بردارید. نتیجه‌ها در آرشیو آثار می‌مانند و می‌توانید آن‌ها را دریافت، حذف یا دوباره‌سازی کنید.
هزینهٔ ساخت تصویر، ویدیو، موسیقی و صدا، به سکه با قیمت امروز

تصویر هر تصویر مربع ۱۰۲۴ در ۱۰۲۴

  • اقتصادی GPT Image 1 mini، کیفیت پایین ۹۱۳ سکه
  • متعادل GPT Image 1 mini، کیفیت متوسط ۳,۱۷۷ سکه
  • حرفه‌ای Nano Banana 2 (Gemini 3.1 Flash Image)، کیفیت 2K ۴۲,۹۲۰ سکه
  • بالاترین کیفیت Nano Banana Pro (Gemini 3 Pro Image)، کیفیت 2K ۶۱,۶۲۶ سکه

ویدیو با صدا هر کلیپ، با مدت همان ردیف

  • اقتصادی Veo 3.1 Lite، ۴ ثانیه ۷۲,۲۱۲ سکه
  • متعادل Veo 3.1 Fast، ۸ ثانیه ۲۸۸,۸۴۸ سکه
  • حرفه‌ای Veo 3.1، ۸ ثانیه ۱,۱۵۵,۳۹۲ سکه
  • بالاترین کیفیت Veo 3.1، ۸ ثانیه ۱,۱۵۵,۳۹۲ سکه

موسیقی هر قطعه

  • کلیپ کوتاه Lyria 3 Clip ۱۴,۴۴۳ سکه
  • قطعهٔ کامل Lyria 3.5 ۲۸,۸۸۵ سکه

متن به گفتار هر ۱۰۰۰ نویسهٔ متن (حدود ۱۸۰ کلمهٔ فارسی)

  • اقتصادی Gemini 3.8 Flash-Lite TTS ۵,۴۸۹ سکه
  • کیفیت بالا Gemini 3.8 Flash TTS ۸,۱۹۷ سکه

گفتار به متن هر دقیقه صدا

  • GPT Transcribe ۱,۶۲۵ سکه
  • Whisper v1 ۲,۱۶۷ سکه

ردیف‌ها همان سطح‌های «بودجه و کیفیت» صفحهٔ تولید محتوا در گیسو هستند. پیش از ساخت، هزینهٔ تقریبی کنار دکمهٔ ساخت می‌آید و مبلغ دقیق بعد از ساخت روی کارت نتیجه ثبت می‌شود.

اگر ویدیو ساخته نشود، کل هزینه‌اش خودکار به اعتبار برمی‌گردد.

به‌روزرسانی: ۱۴۰۵/۰۷/۰۹ ۰۴:۲۴ مبلغ‌ها به سکه، با قیمت امروز همان مدل در گیسو

اگر برای یک ویدیو به صدا، موسیقی و تصویر نیاز دارید، بهتر است صدا را جدا بسازید و روی تدوین کنترل داشته باشید. برای موسیقی پس‌زمینه می‌توانید راهنمای ساخت موسیقی با هوش مصنوعی را بخوانید و برای پرامپت ویدیو هم راهنمای پرامپت ویدیو با Sora کمک می‌کند.

متن فارسی را طوری آماده کنید که درست‌تر خوانده شود

کیفیت TTS فارسی فقط به مدل بستگی ندارد. متن فارسی اگر بی‌نشانه، طولانی و پر از اسم خارجی نوشته شود، حتی مدل خوب هم گاهی بد می‌خواند. قبل از ساخت فایل نهایی، متن را مثل متنی آماده کنید که قرار است یک گوینده آن را بخواند.

واژه‌های چندمعنا را با حرکت‌گذاری روشن کنید

در فارسی، بعضی کلمه‌ها بدون حرکت‌گذاری چند جور خوانده می‌شوند. اگر معنی برای متن مهم است، همان چند واژه را علامت‌گذاری کنید. لازم نیست کل متن را اعراب‌گذاری کنید؛ فقط جاهای مبهم را اصلاح کنید.

قبلبعد
او کرد است.او کُرد است.
این مهر برای بسته‌بندی است.این مُهر برای بسته‌بندی است.
مهر امسال دوره شروع می‌شود.مِهر امسال دوره شروع می‌شود.

عددها را همان‌طور بنویسید که باید شنیده شوند

مدل‌ها معمولاً عدد را می‌خوانند، اما برای نریشن بهتر است ابهام را کم کنید. مخصوصاً وقتی عدد، تاریخ، شمارهٔ نسخه یا زمان است، شکل گفتاری را بنویسید.

قبلبعد
ارسال از ۱۴۰۳/۰۷/۱۲ شروع می‌شود.ارسال از دوازدهم مهر ۱۴۰۳ شروع می‌شود.
ویدیو 40 ثانیه است.ویدیو چهل ثانیه است.
نسخه 2.1 منتشر شد.نسخهٔ دو ممیز یک منتشر شد.

مکث‌ها را با نشانه‌گذاری بسازید

ویرگول، نقطه و شکست بند روی مکث اثر می‌گذارند. اگر همهٔ متن را در یک پاراگراف بلند بگذارید، صدا نفس مصنوعی و ریتم یکنواخت پیدا می‌کند. جمله‌های کوتاه‌تر، خروجی را قابل تدوین‌تر می‌کنند.

قبل:
در این ویدیو یاد می‌گیرید چطور صفحه محصول را بهتر بنویسید ابتدا عنوان را اصلاح می‌کنیم بعد توضیح کوتاه می‌نویسیم و در پایان دعوت به خرید را اضافه می‌کنیم

بعد:
در این ویدیو یاد می‌گیرید چطور صفحهٔ محصول را بهتر بنویسید.
ابتدا عنوان را اصلاح می‌کنیم.
بعد توضیح کوتاه می‌نویسیم.
در پایان، دعوت به خرید را اضافه می‌کنیم.

اسم‌های خارجی را با حروف فارسی بنویسید

اگر نام انگلیسی را همان‌طور رها کنید، مدل ممکن است آن را با تلفظ نامناسب بخواند. در متن نریشن، تلفظ را فارسی کنید. مثلاً به جای Canva بنویسید «کَنوا» یا اگر تلفظ رایج دیگری در مخاطبان شما جا افتاده، همان را بنویسید.

نیم‌فاصله‌ها را هم اصلاح کنید: «می شود» را به «می‌شود» تبدیل کنید، «صفحه محصول» را اگر نقش اضافه دارد «صفحهٔ محصول» بنویسید، و عبارت‌هایی مثل «دوباره سازی» را به «دوباره‌سازی» تغییر دهید. این کار هم خواندن را بهتر می‌کند و هم متن نهایی را برای آرشیو مرتب نگه می‌دارد.

متن‌های بلند را بخش‌بندی کنید و بعد به هم بچسبانید

هر درخواست متن به گفتار تا ۴٬۰۹۶ نویسه می‌پذیرد. برای مقالهٔ صوتی، درس بلند یا فصل کوتاه، متن را از مرز پاراگراف‌ها جدا کنید. هر بخش باید با یک جملهٔ کامل تمام شود؛ وسط جمله برش نزنید، چون اتصال فایل‌ها گوش را اذیت می‌کند.

یک روش عملی این است: متن را به بخش‌های ۶۰ تا ۹۰ ثانیه‌ای تقسیم کنید، نام فایل‌ها را مرتب بگذارید و بعد با ffmpeg آن‌ها را یکی کنید. اگر خروجی‌ها هم‌قالب باشند، دستور اتصال بدون تبدیل دوباره کار می‌کند.

printf "file 'part1.mp3'\nfile 'part2.mp3'\nfile 'part3.mp3'\n" > list.txt
ffmpeg -f concat -safe 0 -i list.txt -c copy full.mp3

اگر بین بخش‌ها اختلاف بلندی صدا شنیدید، به جای اتصال مستقیم، در نرم‌افزار تدوین صدا یا ویدیو سطح صدا را یکسان کنید. برای نریشن درس، چند ثانیه سکوت در ابتدا و انتهای فایل را هم دستی تنظیم کنید.

توسعه‌دهندگان می‌توانند با API فایل صوتی بسازند

برای اپلیکیشن، داشبورد آموزشی یا سامانهٔ پشتیبانی، وب‌سرویس برنامه‌نویسی (API) گیسو با قالب کتابخانهٔ رسمی OpenAI کار می‌کند. نشانی پایه https://gisoo.pro/api/v1 است و کلید را باید در متغیر محیطی GISOO_API_KEY نگه دارید. کلید را در کد فرانت‌اند یا اپ موبایل نگذارید.

نمونهٔ پایتون زیر با gpt-4o-mini-tts صدای nova می‌سازد و برای لحن، دستور فارسی می‌دهد.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["GISOO_API_KEY"],
    base_url="https://gisoo.pro/api/v1",
)

text = "سلام. به پنل آموزش خوش آمدید. از منوی سمت راست، درس بعدی را انتخاب کنید."

speech = client.audio.speech.create(
    model="gpt-4o-mini-tts",
    voice="nova",
    input=text,
    instructions="گرم و آرام، با مکث کوتاه بین جمله‌ها",
)

speech.write_to_file("welcome.mp3")

نمونهٔ Node.js زیر از tts-1 استفاده می‌کند و فایل intro.mp3 را روی سرور می‌نویسد.

import OpenAI from "openai";
import { writeFile } from "node:fs/promises";

const client = new OpenAI({
  apiKey: process.env.GISOO_API_KEY,
  baseURL: "https://gisoo.pro/api/v1",
});

const speech = await client.audio.speech.create({
  model: "tts-1",
  voice: "alloy",
  input: "برای ادامه، گزینهٔ ساخت حساب را انتخاب کنید.",
});

const buffer = Buffer.from(await speech.arrayBuffer());
await writeFile("intro.mp3", buffer);

جزئیات پارامترها، قالب‌های خروجی و مسیرهای صوتی را در مستندات صوتی API ببینید. برای مسیر برعکس، یعنی تبدیل گفتار به متن، گیسو مدل‌های whisper-1 و gpt-4o-transcribe را هم دارد، اما آن موضوع نیاز به راهنمای جداگانه دارد.

شفافیت و حقوق استفاده را از ابتدا جدی بگیرید

سیاست استفادهٔ OpenAI می‌گوید به شنوندگان اطلاع بدهید که صدا با هوش مصنوعی ساخته شده است. این جمله می‌تواند کوتاه باشد: «این صدا با هوش مصنوعی تولید شده است.» برای محتوای آموزشی، تبلیغاتی یا پیام داخل اپ، همین شفافیت ساده جلوی سوءبرداشت را می‌گیرد.

از مدل‌ها برای تقلید صدای شخص واقعی، گویندهٔ شناخته‌شده یا هنرمند مشخص استفاده نکنید. اگر خروجی را در پروژهٔ تجاری منتشر می‌کنید، شرایط ارائه‌دهندهٔ مدل را هم بررسی کنید. گیسو دربارهٔ استفادهٔ تجاری از این خروجی‌ها قرارداد جداگانه‌ای ندارد؛ شرایط خود ارائه‌دهنده ملاک است.

برای شروع، یک متن ۳ تا ۵ جمله‌ای از کار واقعی خودتان بردارید. واژه‌های مبهم را روشن کنید، سرعت را نزدیک حالت عادی بگذارید و یک خروجی کوتاه بسازید. اگر همان نمونه خوب شنیده شد، متن کامل را بخش‌بندی کنید و سراغ نسخهٔ نهایی بروید.

امتحان در گیسو ساخت ویدیو حساب رایگان است؛ برای استفاده از مدل‌ها اعتبار لازم دارید. برای برنامه‌نویس‌ها مستندات وب‌سرویس (API) یک کلید و یک نشانی برای صدها مدل از شرکت‌های مختلف، سازگار با کتابخانهٔ OpenAI.

پرسش‌های پرتکرار

تبدیل متن به گفتار فارسی برای نریشن ویدیو خوب است؟

بله، برای نریشن ریلز، آموزش کوتاه و معرفی محصول کاربردی است. بهتر است اول یک نمونهٔ کوتاه بسازید، چون بعضی واژه‌های فارسی یا اسم‌های خاص ممکن است نیاز به اصلاح نوشتاری داشته باشند.

کدام مدل TTS فارسی را انتخاب کنم؟

برای نمونه‌گیری و پیام‌های ساده، tts-1 انتخاب اقتصادی‌تری است. برای صدای شفاف‌تر tts-1-hd را امتحان کنید. اگر کنترل لحن می‌خواهید، gpt-4o-mini-tts با فیلد instructions مناسب‌تر است.

متن بلند را چطور به صدا تبدیل کنم؟

هر درخواست تا ۴٬۰۹۶ نویسه می‌پذیرد، پس متن بلند را در مرز پاراگراف‌ها جدا کنید. هر بخش را جدا بسازید و بعد فایل‌ها را در نرم‌افزار تدوین یا با ffmpeg به هم وصل کنید.

می‌توانم صدای یک فرد واقعی را تقلید کنم؟

نه، برای تقلید صدای شخص واقعی یا هنرمند مشخص از این ابزار استفاده نکنید. برای انتشار عمومی هم به شنوندگان بگویید صدا با هوش مصنوعی ساخته شده و شرایط ارائه‌دهندهٔ مدل را بررسی کنید.

نوشتهٔ تیم گیسو همهٔ مطالب وبلاگ خوراک RSS