電話から聞こえる声は、本人の声ではない。「声の辞書」から似たものを選んで、合成しているらしい。
そんな話を聞くと、少し落ち着きません。いつも話している家族や友人の声は、いったい誰の声なのでしょうか。
調べると、この説明のもとになった技術はありました。ただし、誰かの録音された声を選び、本人の代わりに再生する仕組みではありません。本人の声を分析し、それに近い音を相手側で再現する技術です。[1][2]
「辞書」という言葉から想像するものと、実際に入っているものが違いました。
「声の辞書」には、誰の声が入っている?
携帯電話などで使われてきた音声圧縮の技術に、CELP(セルプ)という方式があります。
この方式は、人の声を、音のもとになる信号と、その響きを形づくるフィルターを使って表します。人の発声の仕組みを、計算で扱える形に近似したものです。[2]
ここで登場するのが「コードブック」。辞書にたとえられますが、中身は「低い男性の声」「高い女性の声」といった人別の音声ではありません。
音を再現する材料となる、短い信号のパターンです。それをフィルターに通した結果が元の音声に近づくよう、パターンや強さなどを選びます。[2]
しかも、すべてを録音データとして保存しておく必要もありません。CELPの一種であるACELPでは、計算上の規則でパターンを表現します。[3]
辞書の中に、自分によく似た誰かが待機しているわけではなかったのです。
声そのものの代わりに、「再現するための情報」を送る
どうして、そんな手間をかけるのでしょうか。
目的は、送るデータを少なくしながら、元の声に近い音を届けることです。[1]
流れを大まかにすると、次のようになります。
- マイクに入った本人の音声を分析する。
- 元の音に近づく信号パターンや、フィルターなどの設定を求める。
- 選んだパターンの番号や設定値を送る。
- 受信側が、その情報を使って音声を組み立てる。[1][2]
たとえるなら、完成品を丸ごと運ぶ代わりに、共通の材料と作り方を使って向こう側で再現するようなものです。
ただし、会話を文字起こしして読み上げ直す仕組みではありません。処理しているのは、実際に話した声の信号です。
その瞬間の声に合わせて細かく情報を変えるので、話し方や声色も再現の対象になります。「合成」という言葉を使っていても、他人の声へのすり替えとは違います。
「43億種類の声から選ぶ」は本当?
この話と一緒に、「約43億種類から似た声を選ぶ」という数字を見かけることもあります。
KDDIの研究者による解説にも、固定コードブックのパターン数として「2の32乗、約43億」という説明が出てきます。[1]
ただ、これは43億人分の声を録音しているという意味ではありません。その解説が扱う、音の材料の組み合わせの数です。コードブックの構成は方式や動作モードによって異なるため、すべての電話に共通する「声の数」とは受け取れません。[2][3]
数字の大きさよりも、「少ない情報から音声を再現するために、パターンを使う」と考えると分かりやすくなります。
今の電話も、全部同じ仕組みなのか
ここも、ひとまとめにはできません。
たとえば、電話の音声をデジタル化する規格のG.711は、PCMという方法で波形の振幅を数値化します。「コードブックから音の材料を選ぶ」という説明が、そのまま当てはまる方式ではありません。[4]
また、高音質通話向けのEVSは、音声や音楽、利用できるデータ量などに応じて、異なる符号化方法を使います。ドコモの技術資料では、20ミリ秒単位で処理する仕組みも説明されています。1秒に50回です。[5]
スマホの通話アプリでも、採用する技術は一様ではありません。[1]
そのため、「固定電話なら本物、スマホなら偽物」という分け方も適切ではありません。機器の見た目だけで、使われる音声処理を決めつけることはできないのです。
電話だと声が違って聞こえるのは、辞書のせい?
電話越しでは、普段より声が細く聞こえたり、別の家族と聞き違えたりすることがあります。
その理由を「似た別人の声が選ばれたから」と考える必要はありません。電話で伝えられる音の高さの範囲が限られることなどが、聞こえ方に影響します。[1]
高音質通話の技術では、その範囲を広げ、より自然に聞こえるよう改善が進められてきました。[5]
今回の疑問に答えるなら、**「音を合成して再現する方式はある。でも、他人の声の辞書からそっくりさんを選んでいるわけではない」**となります。
電話の向こうで話しているのは、もちろん本人です。その声をできるだけ少ないデータで届けるために、端末の中では、音を分析して組み立て直す処理が続いています。
何気ない「もしもし」の間にも、声を届けるための工夫が詰まっていました。
参考資料
- KDDI「『スマホの声は、本人の声ではない』説は本当?人の声が届く仕組みを解説」2016年公開、2022年更新。KDDI総合研究所の音声・音響技術研究者への取材。コードブック、伝送する情報、約43億という説明、通話音声の帯域について参照。記事中の説明を、すべての現行通話方式に一般化しないよう技術資料と照合した。
https://spark-journal.kddi.com/tsunagu/ts1458/ - Jean-Marc Valin, The Speex Codec Manual, “Introduction to CELP Coding.” 開発者による公式技術資料。音源・フィルターモデル、適応・固定コードブック、音声に近づける探索について。
https://speex.org/docs/manual/speex-manual/node9.html - The Speex Codec Manual, “FAQ.” ACELPの代数的コードブックの説明。
https://www.speex.org/docs/manual/speex-manual/node12.html - ITU-T Recommendation G.711, Pulse code modulation (PCM) of voice frequencies. 電話音声のPCM符号化規格。
https://www.itu.int/rec/T-REC-G.711/en - 堤公孝・菊入圭「VoLTEのさらなる高音質化と音楽の活用を実現する3GPP標準音声符号化方式EVS」『NTT DOCOMOテクニカル・ジャーナル』Vol.22 No.4。EVSの符号化方式の切り替え、フレーム長、高音質化について。
https://www.docomo.ne.jp/binary/pdf/corporate/technology/rd/technical_journal/bn/vol22_4/vol22_4_003jp.pdf

コメント