AI Research / Voice Clone TTS

音声クローンAI
あなたの声で、業務で使える発話

数秒の参照音声から、声質・話し方・抑揚を再現し、
テキストから自然な音声を生成します。

音声クローンAIとは

本プロダクトは、特定の人物の声をもとに、テキスト文章を 音声として発話するTTS(Text-to-Speech)システムです。

数秒の参照音声から、声質・話し方・抑揚を再現し、 入力したテキストをその声に近い形で読み上げます。

従来の合成音声とは異なり、「誰が話しているか」を 再現することに重点を置いています。

デモで試す

参照音声(あなたの声)を選んで、テキストを入力してください
100文字を超えています。  0 / 100文字
参照音声 ※話す方の音声
デフォルト音声(サンプル) 用意されたサンプル音声を使用します
カスタム音声をアップロード WAV ファイル・3〜10秒
クリックまたはドラッグ&ドロップ WAV のみ・3〜10秒(最大 10MB)
50文字を超えています。  0 / 50文字
マイクで録音 ブラウザのマイクで参照音声をその場で録音します(3〜10秒)
静かな環境で 3〜10 秒 を目安に発声してください。
初回はブラウザがマイク許可を求めます。
録音中 00:00 / 00:10
録音完了
50文字を超えています。  0 / 50文字
生成中です。しばらくお待ちください…(通常1分前後・初回アクセス時は2〜3分)
生成完了
ダウンロード

※ 生成音声は1日毎に削除されます。必要な場合はダウンロードしてください。

活用シーン

動画ナレーション

収録なしで音声生成。修正も即時対応可能。

社内教育・業務音声

統一された音声で、教育・案内コンテンツを自動化。

AIプロダクト連携

アバター・受付・音声UIへの組み込みにも対応。

技術構成

  • GPT-SoVITS ベース音声生成
  • ローカル推論(外部APIなし・データ外部送信なし)
  • 短時間音声(3〜10秒)から生成可能

動作要件

  • Python 3.8 以上
  • PyTorch(CUDA対応推奨)
  • GPU 推奨(VRAM 6GB 以上)
  • CPUでも動作可能(処理時間は増加)
  • OS:Windows

料金

相談

オンライン 30 分

無料

モデル納入

ソース・モデル・マニュアル提供

10万円

導入サポート

環境構築・初期設定支援

10万円〜

カスタマイズ / ファインチューニング

用途に応じた最適化・精度向上

30万円〜
まずはご相談ください 利用用途や環境に応じて、最適な構成をご提案します。
まずはメールでお気軽にお問い合わせください。