最近、動画や音声まわりのAIツールをいろいろ見ています。

その中で、目にすることが増えたのが「音声クローン」という機能です。

私はずっと、音声クローンは自分の声を録音して、それをAIで再現するものだと思っていました。作った声を自分の動画やコンテンツで使う、かなり個人的な機能というイメージです。

でも、最近見ていたサービスの中に少し違う使い方がありました。

【ここに1枚目の画像:Community Voicesの画面】

最初に自分の声を作らなくてもいい?

ちょっと面白いと思ったのが、自分の声を録音するところから始めなくてもいいことです。

すでに誰かが共有している声を探して、用途に合うものがあれば使う。実際に見たのは、FreeVoiceCloneの「コミュニティで共有されている音声」のページでした。

言語だけでなく、男性・女性、年齢、ナレーション向けなど、いくつかの条件を見ながら声を選べます。

これまで私が想像していた流れは、

「声が必要 → 自分で録音する → クローンを作る」

というものでした。

共有ライブラリを使う場合は、

「声が必要 → まず探してみる → 合うものがあれば使う」

という流れになります。

簡単な解説動画やテスト用のナレーションなら、毎回ゼロから声を作らなくてもよさそうです。こういう使い方があるのは少し意外でした。

自分の声が「共有される側」になることも

逆の使い方もあります。

自分で作った声をコミュニティに共有すると、別の人がその声を見つけて使うことができます。

つまり、

自分の声 → 自分だけで使う

だけでなく、

自分の声 → コミュニティ → 別の人が使う

という形もあるわけです。

ここは、私がイメージしていた音声クローンとは少し考え方が違いました。自分専用の声を作るだけではなく、声そのものが共有されることになります。

ただし、声はフォントや画像素材と同じようには扱えません。その人の個性やidentityにかなり近いものだからです。

誰の声なのか。本人が公開に同意しているのか。どのような用途で使ってよいのか。

共有する側も使う側も、このあたりは先に確認しておいた方がいいと思います。便利に使えることと、自由に使ってよいことは別です。

気になったのは多言語での使い方

もう一つ気になったのが、多言語への対応です。

たとえば英語を話している声を聞くと、なんとなく「英語の声」という印象を持ちます。日本語なら日本語の声、スペイン語ならスペイン語の声、という感じです。

でもクローン音声は、元の音声で使われていた言語だけに固定されるとは限りません。

同じクローン音声を「500以上の言語」で使えるという点は、多言語コンテンツを考える時にちょっと面白いと思いました。

一つの声を決めて、

英語版

スペイン語版

日本語版

アラビア語版

というように、声を変えずに言語だけを切り替える使い方ができます。

一つの動画を複数の言語に展開する時、毎回違う声を探すより、同じ声を使った方が全体の雰囲気をそろえやすそうです。

「500以上の言語」でも確認は必要

対応する言語が多いからといって、生成した音声をそのまま使えるとは限りません。

名前や専門用語の発音がおかしくなることもあります。言語が変われば、同じ内容でも文章の長さや話す時間が変わります。

英語では5秒に収まった文章が、日本語では少し長くなることもあれば、その逆もあります。

実際に使うなら、少なくとも次の点は自分で聞いて確認した方がよさそうです。

  • 発音
  • 話すスピード
  • 間の取り方
  • 名前や専門用語
  • 翻訳した文章が自然に聞こえるか

文章としては正しくても、声にすると不自然に聞こえる場合があります。そんな時は音声の設定を変えるより、文章を少し言い換えた方が自然になることもありそうです。

AIが音声を作ってくれても、最後に聞いて判断する作業は残ります。

私ならこんな場面で使いそう

共有されている声を先に探す方法は、次のような用途と相性がよさそうです。

  • 短いYouTube動画
  • 簡単な解説動画
  • 多言語版を試してみたい時
  • 仮のナレーションを入れたい時
  • 動画を作る前のテスト

こうした用途なら、最初から専用の声を作るより手軽に試せそうです。

一方で、自分のブランドやキャラクターとして長く使う声なら、専用の音声クローンを作った方が合っているかもしれません。

どちらが優れているというより、声をどのくらい長く使うのか、声そのものにどれだけ意味があるのかで選び方が変わりそうです。

音声クローンの見方が少し変わった

これまでは「AIで自分の声を再現する」という部分ばかり見ていました。

今回、他の人が共有した声を探して使う方法もあると知って、音声クローンに対する見方が少し変わりました。

同じ声を500以上の言語で使えるなら、自分の声をコピーする機能だけでなく、多言語コンテンツで声をそろえる方法としても考えられます。

ただ、声は本人の個性やidentityに近いものです。公開や利用に関する同意、許可、使える範囲については、便利さとは分けて考える必要があります。

その点をきちんと確認しながら使うものだと思いますが、こうした共有型の音声ライブラリがこれから増えていくのかは少し気になっています。