Ok Googleこの曲は何?鼻歌検索の裏技と認識しない時の対処法

Ok Googleこの曲は何?鼻歌検索の裏技と認識しない時の対処法の背景について、最新情報を基に徹底解説します。

街中を歩いているときや店舗で買い物をしている際、店内で流れている曲調べる方法として最も手軽なのが、スマートフォンの音声認識エンジンを活用したアプローチです。スマートフォンに「OK Google、この曲は何?」、あるいは「この曲教えて」と話しかけるだけで、端末の内蔵マイクが音を拾い、数秒後には画面にジャケット写真、曲名、アーティスト名、YouTubeや音楽ストリーミングサービスへのリンクが整然と表示されます。

このGoogleアシスタント曲名特定の根底にあるのは、Googleが長年培ってきた膨大な音響データベースと機械学習モデルです。既存の楽曲がスピーカーから流れている場合、システムは「アコースティック・フィンガープリント(音響指紋)」と呼ばれる技術を用います。これは楽曲の周波数特性や時間変化を固有のデジタルコードに変換し、データベースと照合する仕組みです。CD音源はもちろん、ライブ版やカバー曲であっても、コード進行や音の響きからミリ秒単位で照合が行われます。

一方、世界中のエンジニアを驚嘆させたのが、2020年秋に実装され現在では標準機能となったAndroidハミング検索およびiPhone Googleアプリ音楽検索に搭載されている「ハミング認識モデル」です。原曲の演奏が存在せず、人間の不完全な鼻歌や口笛しかない状態から、どうやって目的の曲を探し当てているのでしょうか。

Googleの公式リサーチ発表資料によると、このシステムは人間の歌声を「メロディラインの数値シーケンス(音程の高低差とリズムの相対的パターン)」へと変換します。つまり、歌っている人の声質や音色の違い、楽器の伴奏の有無をすべて削ぎ落とし、純粋な「メロディの骨格」だけを抽出するのです。抽出された骨格は、あらかじめ機械学習によって同様の数値シーケンスに変換された数千万曲以上の商用楽曲データベースと照合されます。そのため、多少キー(調)が外れていたり、テンポが走ってしまったりしても、メロディの相対的な上下関係が一致していれば、AIが「一致率85%」といった確率順で候補曲を弾き出すことができるのです。

中川 明日香

中川 明日香

ビジネス戦略アナリスト

エンタメ・カルチャー業界の深掘り取材を得意とし、現場のリアルな声をお伝えします。

Share this article
Twitter Facebook Pinterest