特集:Voice AI
Google ColabをAPIサーバー化してS2S音声対話を動かしてみた
Google ColabのGPU環境をngrokで一時公開し、WebSocket経由で動くS2S音声対話AIのPoCを構築しました。faster-whisper large-v3による音声認識、Gemini 2.5 Flash-Liteのストリーミング応答、VOICEVOXの並列音声合成、Silero VADを組み合わせ、発話終了から最初の音が返るまでのレイテンシを改善した方法を紹介します。
Geminiで音声対話AIを開発して分かった、PoCと商用サービスの大きな違い
Gemini Live APIで音声対話AIのPoCを構築し、商用化へ進む中で同時接続、429エラー、モデル更新、ログ監視、ブラウザや端末固有の音声問題に直面しました。Gemini APIからVertex AIとLiveKitを使う構成へ移行した経験をもとに、PoCと本番開発の違い、Webとネイティブアプリの選び方、商用開発前に確認すべき項目を解説します。
テキスト読み上げAI(TTS)でベトナムニュースの日本語ラジオを構築
OpenAIの翻訳APIとTTSを活用し、ベトナム語ニュースを日本語に翻訳して自然な音声で読み上げるラジオアプリの裏側。
【プロンプト有】ChatGPT JSONモードとOpenAI TTSで記事を自動要約&音声化
技術記事をChatGPTで自動要約し、OpenAI TTSを用いてポッドキャスト用の音声を自動生成する配信ツールを開発しました。



