DAILY

Geminiで自分の声を作ったら、僕より僕だった

Geminiで作った僕の声のAIは本人より僕らしく、別のサービスは短い文では良くても長い台本で僕の名前を読み間違えたので、声のAIは本番と同じ長さの台本で比べて選ぶのが確実です。

9月24日の夕方、作業を手伝ってもらっていたAIから「テスト音声ができました。確認してください」と届きました。再生すると、僕がしゃべっています。でも僕はしゃべっていない。思わず画面に向かって「お前、これ完全に俺の声じゃないか。完璧すぎるだろ」と打ち込んでいました。

本人の僕より、僕っぽかった。確認した瞬間に「俺やないかい」と普通にツッコんでしまったくらいです。

実は、このDaily Revolutionには翌25日から音声版があります。あれを読んでいるのは、そのとき作った僕の声のAIです。本人は一言もしゃべっていません。

Googleは、僕が声を作る前日の23日に30秒ほどの音声から声を再現できる新しい読み上げモデル、Gemini 3.8 Flash TTSを出していました。その5日後にはElevenLabsも新しいモデルを出しています。自分の声でナレーションやポッドキャストを作れるのか、気になっている人も多いと思います。

僕はこの1週間で両方を自分の声で作り、本番で使う方を1つに決めて、もう片方はその夜のうちに解約しました。そのとき分かったことを書きます。


20秒しゃべって、英語で同意した

きっかけは単純で、Googleから声を作れるモデルが出たので、無料の範囲で使えるなら一回やってみよう、というだけでした。僕の発信は、これまで記事だけでした。声が作れれば、毎日の記事をそのまま音声でも出せるかもしれない。

作業はGoogle AI Studioという開発者向けの画面でやりました。支払いの設定で最初に800円のチャージが必要だったので、それだけ入れて、自動チャージは切っておきました。

僕が実際にしゃべったのは、20秒ぐらいです。拍子抜けするほど短い。

手こずったのは別のところでした。見本として読み上げる文も、「この声を作ることに同意します」という録音も、画面の指示が全部英語だったんです。僕は英語がまったく話せません。日本語に訳して読んでみたら、それでは通りませんでした。途中で画面がおかしくなって録音できなくなったり、できたはずの声が一覧に出てこなかったり。AIに「そんな画面ない」「だからどこにあんだよ」と文句を言いながら、最後はAIが手順を組み直してくれて、なんとか通りました。

この同意の録音は、Googleの説明にも出てきます。声の持ち主本人の同意を録音して、それが見本の声と一致しないと作れない仕組みです。他人の声を勝手に作れないようにするための手間なので、面倒ではあるけれど、あって当然だと思います。


声は合格。引っかかったのは台本と読み方

できあがった声には、本当に驚きました。20秒でここまで来るのかと。

ただ、驚いてばかりもいられませんでした。試しにその日の記事をそのまま読ませてみると、今度は機械っぽくなりました。抑揚は悪くないし、声も確かに僕なのに、全体としてAIが読んでいる感じが消えない。

声というより、読ませている文章の方に原因がありそうでした。目で読むために書いた文を、そのまま耳で聞いているからです。そこでAIに提案された「耳で聞く台本に直してから読ませる」をやってみることにしました。

そのあと3つの読み方を聞き比べて、決めていきました。一番本人に近かったのはB。話し方はCの方が聞きやすかったけれど、Cは少しAIっぽさが戻っていた。なので、その間を狙って、ポッドキャスト向けにもう少し調整してもらいました。

細かい引っかかりも、聞いてみて初めて出てきました。

  • 無音が寂しいので入れたBGMが、しゃべり始めると急に小さくなり、止まると急に大きくなる。自動の音量調整が不自然で聞き疲れするので、やめてもらいました。曲は、僕が好きなピアノのクラシック寄りにしています。
  • 冒頭で「今日のデイリーは」と言っていた。デイリーは日本語で「今日」なので、「今日の今日は」と言っているのと同じです。「今日のDaily Revolutionは」に直しました。
  • 一番の問題は漢字でした。僕の名前は読み間違えられやすくて、AIの声でも同じことが起きた。読み方はAIの側で調整してもらっています。

この段階での僕の採点は、音声としては80点でした。冒頭の決まり文句には「この放送は僕の声をもとにしたAI音声でお届けしています」という一文を入れています。


短い文なら、ElevenLabsが一番だった

28日には、音声AIの会社ElevenLabsが新しいモデルのEleven v4を出しました。10秒の音声で声を写せるとうたっています。今使っている声を超えるなら乗り換えればいいので、29日の0時すぎに有料プランに入って、一番精度が高いという作り方で自分の声を作りました。

ここで小さな事件がありました。声を作るために僕が読み上げる見本の文に、難しい漢字が並んでいて、僕が読めなかったんです。AIに「俺がしゃべるやつ、漢字が難しくて読めないんだけど」と言って、読める文に替えてもらいました。

短い文で3つの声を聞き比べると、一番精度が高かったのはElevenLabsの新しいモデルで作った声でした。正直、Geminiより良い。ところどころ音がキンキン割れるのは気になりましたが、「これは乗り換えかな」と思いました。

念のため、前日に実際に配信した回の台本で、GeminiとElevenLabsの両方に読ませました。

結果は逆転です。長い台本になると、Geminiの方が圧倒的に良かった。ElevenLabsの方は僕の声で作ったはずなのに僕じゃない人の声になっていて、漢字の読み間違いも多く、音質も落ちました。極めつけに、僕の名前まで読み間違えていました。

見本の漢字を読めなかった僕の声で、僕の名前を読めないAIができた。笑うしかありません。

有料プランに入ってから解約するまで、2時間ほどでした。アカウントだけは残してあります。

英語ならもっと流暢なのかもしれません。僕が試したのは日本語だけです。ただ、日本語の長い台本を毎日読ませる使い方なら、僕の場合はGemini一択でした。


声を作る前に、決めておくこと

この1週間で分かったのは、声のAIは「声が似ているか」より、「本番の長さで崩れないか」で差が出るということです。自分の声を作ってみたい人に、僕なら次の順番をすすめます。

  • 比べるときは、短い見本ではなく本番と同じ長さの台本を使う。僕の場合、短い文と長い台本で順位が入れ替わりました。
  • 名前や地名など、読み間違えられると困る言葉の一覧を先に作っておく。僕の音声で一番の問題になったのは、声ではなく漢字の読みでした。
  • 記事をそのまま読ませない。耳で聞くための台本に直してから読ませる。
  • 同意の録音が必要なので、時間には余裕を見ておく。僕のときは同意の文が英語で、そこで一番手こずりました。国や地域によっては、そもそも声を再現する機能が使えないとGoogleは書いています。
  • 聞く人に、AIの声だと最初に伝える。
  • 作るのは自分の声か、使っていいと本人から許可をもらった声だけにする。

僕が2時間で解約を決められたのは、最後に本番の台本で比べたからです。短い文だけで決めていたら、たぶん乗り換えていました。


声の問題は、ほぼ片付いた

調整した音声を聞いたとき、僕は「ポッドキャストとしては、めちゃくちゃいい感じ」と言っていました。そのすぐあとに、こうも言っています。「そもそも記事の内容が悪い」。

声が本人より本人らしくなっても、読んでいる中身がつまらなければ、最後まで聞いてはもらえません。声の方はもう、20秒と800円でだいたい片付きました。残っているのは、毎朝読ませる文章の方です。


制作プロセス

このコンテンツは、僕自身の一次情報をもとに制作しています。

出典1:ボイスクローンを作ったら、僕より僕だった
出典2:ElevenLabsで声をクローンしてみたけど、長い台本はGeminiの方がよかった

AI活用

制作には、以下のAIモデルを使用しています。

文章:Claude Opus 5.5

ニュースレター

今週の大事な変化と、それをどう判断し、どう動いたかを毎週まとめています。

購読:Weekly Revolution