音声合成が「モデルを1つ足すだけ」の時代に
これまでTTSを組み込むには、専用SDKの学習・認証・使用量モニタリングを別々に用意する必要がありました。今回Vercel AI Gatewayにgoogle/gemini-3.8-flash-ttsとgoogle/gemini-3.8-flash-lite-ttsが追加され、その手間が大きく削減されます。
まず要点を整理します。
- 100言語以上に対応、長文ナレーションも可能
- 自然言語プロンプトでトーン、ペース、演技指示(acting cue)、アクセント、キャラクターボイスを制御
- 2話者対話(two-speaker dialogue) に対応 → ポッドキャスト形式の自動生成が現実的に
- AI Gateway上で使用量・コスト追跡、ルーティングルール、BYOK(自前キー)を一元管理
つまり、LLM・画像・埋め込みを繋いでいたパイプラインに、同じインターフェースで音声まで乗るという話です。根拠資料はVercel公式チェンジログで確認できます。

まずはコード — 30秒でwavを出力する
AI SDKのexperimental_generateSpeechを使えば、これだけで完結します。TTS専用SDKを別途覚える必要はありません。
// AI SDKの実験的音声生成APIとNodeのファイルシステムモジュールを読み込みます
import { experimental_generateSpeech as generateSpeech } from 'ai';
import { writeFile } from 'node:fs/promises';
// Flash-Lite TTSで日本語音声を生成します
const result = await generateSpeech({
model: 'google/gemini-3.8-flash-lite-tts',
text: 'オーディオエディションへようこそ。',
voice: 'Kore', // ボイスプリセットを指定
outputFormat: 'wav', // 出力フォーマット(wavなど)
});
// 生成された音声バイナリをファイルに保存します
await writeFile('speech.wav', result.audio.uint8Array);
result.audio.uint8Arrayがそのままファイルになるため、S3へのアップロードでもストリーミング応答でも、その上に載せるだけで済みます。
Flash-Lite と Flash の使い分け
- Flash-Lite TTS: 大量生成向け。トーン・ペーシング・行単位のデリバリー制御が必要な場合。コスト効率を優先するならこちら。
- Flash TTS: 自然言語プロンプトによるキャラクター設計向け。アクセント、感情リアクション、会話的な演技が必要な場合。
どちらもFlash-Lite TTSプレイグラウンドまたはFlash TTSプレイグラウンドで即座に試せます。セットアップ手順はspeech quickstartとtext-to-speechガイドにまとまっています。

実務で注意すべきポイント
便利だからといってそのまま本番投入する前に、いくつか押さえておきたい点があります。
experimental_接頭辞が付いている以上、APIシグネチャが変更される可能性があります。本番導入するなら薄いラッパーで包み、差し替えコストを抑えてください。- 長文ナレーションはチャンク分割が安全です。一度に数万文字を投げるとレイテンシとコストが同時に跳ねます。
- ボイスの一貫性: 自然言語プロンプトでキャラクターを作ると、シリーズ物でトーンがぶれる可能性があります。プロンプトを定数化しバージョン管理しましょう。
- コスト追跡はAI Gatewayダッシュボードでリクエスト単位に確認できます。モデル別にタグを付けておくと後々の集計が楽です。
- BYOKを使えば自前のプロバイダキーでルーティングでき、組織ポリシー上外部ゲートウェイが使えない環境でも回避策になります。
特に日本のエンタープライズ/SI案件では、音声データが個人情報に紐づくケースが多いため、TTS出力の保存先と保持期間を最初に決めておくことを推奨します。デモは簡単でも、コンプライアンスは別問題です。

結論: 今導入すべきか
結論として、**「音声機能は必要だがTTS SDKの学習コストで後回しにしていたチーム」**にとっては今がタイミングです。すでにAI Gatewayを使っているならモデル名を追加するだけ、そうでなくてもゲートウェイ1つでLLM・画像・音声を統合管理できるメリットは小さくありません。
次のステップとしては以下の順序を推奨します。
- Flash-Lite TTSで短いナレーションパイプラインをまず通す
- 2話者対話機能でポッドキャスト/音声ブリーフィングのプロトタイプ
- Flash TTSの自然言語プロンプトでブランドボイスを定義
- AI Gatewayルーティングルールでコスト上限を設定
あわせて読みたい
音声合成はもはや「特別な機能」ではなく、パイプラインの標準部品になりつつあります。早めに手に馴染ませておけば、次のプロジェクトで必ず役に立ちます。