AI Research / Voice Clone TTS
音声クローンAI
あなたの声で、業務で使える発話
数秒の参照音声から、声質・話し方・抑揚を再現し、
テキストから自然な音声を生成します。
音声クローンAIとは
本プロダクトは、特定の人物の声をもとに、テキスト文章を 音声として発話するTTS(Text-to-Speech)システムです。
数秒の参照音声から、声質・話し方・抑揚を再現し、 入力したテキストをその声に近い形で読み上げます。
従来の合成音声とは異なり、「誰が話しているか」を 再現することに重点を置いています。
デモで試す
参照音声(あなたの声)を選んで、テキストを入力してください
100文字を超えています。
0 / 100文字
参照音声 ※話す方の音声
デフォルト音声(サンプル)
用意されたサンプル音声を使用します
カスタム音声をアップロード
WAV ファイル・3〜10秒
クリックまたはドラッグ&ドロップ
WAV のみ・3〜10秒(最大 10MB)
50文字を超えています。
0 / 50文字
マイクで録音
ブラウザのマイクで参照音声をその場で録音します(3〜10秒)
静かな環境で 3〜10 秒 を目安に発声してください。
初回はブラウザがマイク許可を求めます。
初回はブラウザがマイク許可を求めます。
録音中
00:00 / 00:10
録音完了
50文字を超えています。
0 / 50文字
生成中です。しばらくお待ちください…(通常1分前後・初回アクセス時は2〜3分)
活用シーン
動画ナレーション
収録なしで音声生成。修正も即時対応可能。
社内教育・業務音声
統一された音声で、教育・案内コンテンツを自動化。
AIプロダクト連携
アバター・受付・音声UIへの組み込みにも対応。
技術構成
- GPT-SoVITS ベース音声生成
- ローカル推論(外部APIなし・データ外部送信なし)
- 短時間音声(3〜10秒)から生成可能
動作要件
- Python 3.8 以上
- PyTorch(CUDA対応推奨)
- GPU 推奨(VRAM 6GB 以上)
- CPUでも動作可能(処理時間は増加)
- OS:Windows
料金
相談
オンライン 30 分
無料モデル納入
ソース・モデル・マニュアル提供
10万円導入サポート
環境構築・初期設定支援
10万円〜カスタマイズ / ファインチューニング
用途に応じた最適化・精度向上
30万円〜