電話の声は合成音?「本人の声ではない」説を調べてみた

電話から聞こえる声は、本人の声ではない。「声の辞書」から似たものを選んで、合成しているらしい。

そんな話を聞くと、少し落ち着きません。いつも話している家族や友人の声は、いったい誰の声なのでしょうか。

調べると、この説明のもとになった技術はありました。ただし、誰かの録音された声を選び、本人の代わりに再生する仕組みではありません。本人の声を分析し、それに近い音を相手側で再現する技術です。[1][2]

「辞書」という言葉から想像するものと、実際に入っているものが違いました。

「声の辞書」には、誰の声が入っている?

携帯電話などで使われてきた音声圧縮の技術に、CELP(セルプ)という方式があります。

この方式は、人の声を、音のもとになる信号と、その響きを形づくるフィルターを使って表します。人の発声の仕組みを、計算で扱える形に近似したものです。[2]

ここで登場するのが「コードブック」。辞書にたとえられますが、中身は「低い男性の声」「高い女性の声」といった人別の音声ではありません。

音を再現する材料となる、短い信号のパターンです。それをフィルターに通した結果が元の音声に近づくよう、パターンや強さなどを選びます。[2]

しかも、すべてを録音データとして保存しておく必要もありません。CELPの一種であるACELPでは、計算上の規則でパターンを表現します。[3]

辞書の中に、自分によく似た誰かが待機しているわけではなかったのです。

声そのものの代わりに、「再現するための情報」を送る

どうして、そんな手間をかけるのでしょうか。

目的は、送るデータを少なくしながら、元の声に近い音を届けることです。[1]

流れを大まかにすると、次のようになります。

  1. マイクに入った本人の音声を分析する。
  2. 元の音に近づく信号パターンや、フィルターなどの設定を求める。
  3. 選んだパターンの番号や設定値を送る。
  4. 受信側が、その情報を使って音声を組み立てる。[1][2]

たとえるなら、完成品を丸ごと運ぶ代わりに、共通の材料と作り方を使って向こう側で再現するようなものです。

ただし、会話を文字起こしして読み上げ直す仕組みではありません。処理しているのは、実際に話した声の信号です。

その瞬間の声に合わせて細かく情報を変えるので、話し方や声色も再現の対象になります。「合成」という言葉を使っていても、他人の声へのすり替えとは違います。

「43億種類の声から選ぶ」は本当?

この話と一緒に、「約43億種類から似た声を選ぶ」という数字を見かけることもあります。

KDDIの研究者による解説にも、固定コードブックのパターン数として「2の32乗、約43億」という説明が出てきます。[1]

ただ、これは43億人分の声を録音しているという意味ではありません。その解説が扱う、音の材料の組み合わせの数です。コードブックの構成は方式や動作モードによって異なるため、すべての電話に共通する「声の数」とは受け取れません。[2][3]

数字の大きさよりも、「少ない情報から音声を再現するために、パターンを使う」と考えると分かりやすくなります。

今の電話も、全部同じ仕組みなのか

ここも、ひとまとめにはできません。

たとえば、電話の音声をデジタル化する規格のG.711は、PCMという方法で波形の振幅を数値化します。「コードブックから音の材料を選ぶ」という説明が、そのまま当てはまる方式ではありません。[4]

また、高音質通話向けのEVSは、音声や音楽、利用できるデータ量などに応じて、異なる符号化方法を使います。ドコモの技術資料では、20ミリ秒単位で処理する仕組みも説明されています。1秒に50回です。[5]

スマホの通話アプリでも、採用する技術は一様ではありません。[1]

そのため、「固定電話なら本物、スマホなら偽物」という分け方も適切ではありません。機器の見た目だけで、使われる音声処理を決めつけることはできないのです。

電話だと声が違って聞こえるのは、辞書のせい?

電話越しでは、普段より声が細く聞こえたり、別の家族と聞き違えたりすることがあります。

その理由を「似た別人の声が選ばれたから」と考える必要はありません。電話で伝えられる音の高さの範囲が限られることなどが、聞こえ方に影響します。[1]

高音質通話の技術では、その範囲を広げ、より自然に聞こえるよう改善が進められてきました。[5]

今回の疑問に答えるなら、**「音を合成して再現する方式はある。でも、他人の声の辞書からそっくりさんを選んでいるわけではない」**となります。

電話の向こうで話しているのは、もちろん本人です。その声をできるだけ少ないデータで届けるために、端末の中では、音を分析して組み立て直す処理が続いています。

何気ない「もしもし」の間にも、声を届けるための工夫が詰まっていました。

参考資料

  1. KDDI「『スマホの声は、本人の声ではない』説は本当?人の声が届く仕組みを解説」2016年公開、2022年更新。KDDI総合研究所の音声・音響技術研究者への取材。コードブック、伝送する情報、約43億という説明、通話音声の帯域について参照。記事中の説明を、すべての現行通話方式に一般化しないよう技術資料と照合した。
    https://spark-journal.kddi.com/tsunagu/ts1458/
  2. Jean-Marc Valin, The Speex Codec Manual, “Introduction to CELP Coding.” 開発者による公式技術資料。音源・フィルターモデル、適応・固定コードブック、音声に近づける探索について。
    https://speex.org/docs/manual/speex-manual/node9.html
  3. The Speex Codec Manual, “FAQ.” ACELPの代数的コードブックの説明。
    https://www.speex.org/docs/manual/speex-manual/node12.html
  4. ITU-T Recommendation G.711, Pulse code modulation (PCM) of voice frequencies. 電話音声のPCM符号化規格。
    https://www.itu.int/rec/T-REC-G.711/en
  5. 堤公孝・菊入圭「VoLTEのさらなる高音質化と音楽の活用を実現する3GPP標準音声符号化方式EVS」『NTT DOCOMOテクニカル・ジャーナル』Vol.22 No.4。EVSの符号化方式の切り替え、フレーム長、高音質化について。
    https://www.docomo.ne.jp/binary/pdf/corporate/technology/rd/technical_journal/bn/vol22_4/vol22_4_003jp.pdf
  • URLをコピーしました!

この記事を書いた人

余禄log 管理人
日常でふと気になったことを調べています。
歴史、文化、生き物、科学、心理などジャンルは気分次第。
知らなくても困らない。でも、知るとちょっと面白い。そんな情報をまとめています。

コメント

コメントする

CAPTCHA


目次