【新AI】Google「EmbeddingGemma 2」発表!スマホの動画を言葉で探せる?オフライン検索を解説

Google DeepMindから、新しいAIモデル「EmbeddingGemma 2 (エンベディング・ジェマ・ツー)」が発表されました。
スマホに保存した動画の中から、「犬がフリスビーをキャッチした場面」を言葉で探せるようになります。
しかも、検索の処理はネット接続なしで、端末の中だけで動かせます。
これはスマホの検索をどこまで変えるのか、公開されたデモとモデルの中身を見ていきましょう。
【新AI】Google「EmbeddingGemma 2」発表!スマホの動画を言葉で探せる?オフライン検索を解説
動画の場面を探せる
まずは、一番分かりやすい使い方からです。
Googleの「Video Moments Finder」では、端末内の動画を選び、探したい場面を文章で入力します。
たとえば「子どもたちが笑っている場面」や「犬がフリスビーをキャッチした場面」です。
すると、動画の中から条件に近い瞬間を探して、その時刻を表示します。
長い動画を最初から見返して、目的の数秒を探す手間が減るわけです。
もう一つの「Instant Media Search」では、スマホ内の写真や動画を、文章や参考画像から探せます。
Googleはさらに、音声メモを手がかりに動画の場面を探す使い方も紹介しています。
写真の名前を覚えていなくても、場面の意味で探せるのは、かなりワクワクしますね。
Googleの公式デモでは、動画から映像と音の特徴を読み取り、検索しやすい形にして端末内へ保存します。
その後、入力した言葉と特徴を比べ、意味が近い場面の時刻を探します。
動画の内容をすべて文章に書き起こしたり、場面ごとに説明文を作ったりする必要はありません。
「犬がフリスビーをキャッチ」と打つだけで、その瞬間へ飛べるのは、動画を撮りっぱなしにしがちな人にはかなり便利です。
写真と動画の検索では、参考にしたい画像を選んで、見た目や内容が近いものを探すこともできます。
入力するたびに結果が更新される検索も、Googleが公式デモで示しています。
一方、音声メモから動画を探す例は、モデルで可能な活用例として紹介されたものです。
アプリで公開された個々のデモと、モデルが対応する使い方は、分けて見ておきたいところです。
5種類のデータをつなぐ仕組み
ここからは、検索の仕組みを簡単に見ていきます。
前世代の「EmbeddingGemma」は、主に文章を検索するためのモデルでした。
「EmbeddingGemma 2」は、文章、コード、画像、動画、音声を横断して扱います。
異なる種類のデータを、意味の近さで比べられる共通の形式に変換するんです。
だから、「犬が走っている」という文字と、実際に犬が走る映像を結び付けられます。
ここは誤解しやすいのですが、このモデルは会話の答えや動画の要約を自分で作るAIではありません。
膨大なデータの中から、探したいものに近い候補を見つけるためのAIです。
たとえば「海辺の夕日」という文章から、その景色の写真と、波音の録音を同じ検索対象にできます。
別々の検索エンジンを用意せず、共通の物差しで似ているものを並べられるわけです。
Googleの開発者向け資料では、画像だけでなく、PDFやスライド、グラフなどの視覚資料も扱えると説明しています。
文字と画像が混ざった資料まで探せるなら、スマホの写真整理だけでなく、仕事のファイル検索にも広がります。
前世代からの進化は、対応するデータの種類だけではありません。
Googleの評価では、コード検索の指標「MTEB Code」が68.76から78.68へ上がりました。
コードの意味から、関係する処理や資料を探す用途にも力を入れています。
この数値はGoogleが示したベンチマークで、手元のアプリで検索精度が必ず同じだけ上がるという話ではありません。
スマホで動くサイズ
次は、端末の中だけで動かせる理由です。
必要な機能だけを使える点も、今回のモデルの特徴です。
文章とコードだけなら2.7億、画像も使うなら4.4億、音声も使うなら5.7億パラメータという構成を選べます。
画像と音声を両方使うフル構成が7.4億パラメータです。
写真だけを探すアプリが、音声用の部分まで常に読み込む必要はありません。
Googleによると、量子化したフルモデルは「Pixel 11 Pro」で約567MBのアクティブRAMで動作します。
これはGoogleが示した特定の端末と構成での数値で、どのスマホでも同じになるという意味ではありません。
それでも、写真や動画を探す処理をクラウドへ送らずに済む設計は魅力的です。
通信できない場所でも使えますし、個人のメディアを端末内に置いたまま検索できます。
さらに、検索のために保存するデータも、用途に合わせて小さくできます。
Googleによると、1件あたりの特徴量は768次元から256次元、さらに128次元まで縮められます。
128次元なら、検索用データの保存容量を最大で約6分の1にできます。
その分、画像や動画、音声の検索精度は下がりやすく、Googleは用途に合わせた検証を勧めています。
端末内で大量のデータを扱うには、モデル本体だけでなく、検索用データの置き場所も重要なんです。
一度に扱える量
一度に読み込める情報量も、前世代より増えました。
入力できる情報量は8,192トークンで、前世代の4倍です。
Googleの説明では、1回の入力で最大約5分半の音声、29枚の画像、または58フレームの動画を扱えます。
これらは、それぞれ1種類のデータだけを入れた場合の目安です。
動画全体を何時間でも一度に読み込めるという意味ではありません。
長い動画を探すアプリでは、場面を分けて特徴を記録し、そこから該当する時刻を探します。
この設計なら、長時間の記録から必要な数秒を見つける使い方も想像しやすいですね。
今すぐ使える?
最後に、今の利用方法を整理します。
モデルはApache 2.0ライセンスで公開され、開発者はHugging FaceやKaggleから入手できます。
一般の人も、AndroidとiPhone向けの「Google AI Edge Gallery」で、写真・動画検索の公式デモを試せます。
現時点で、スマホの写真アプリ全体にこの機能が標準搭載されたという発表ではありません。
開発者向けには、Googleが「sentence-transformers」や「LiteRT」など、複数の利用方法を案内しています。
公式デモを試す場合は、アプリの最新版で「Instant Media Search」か「Video Moments Finder」を探してください。
GoogleはMac向けの実験アプリ「Google AI Edge Foresight」も公開しました。
こちらは会議の音声や個人のファイルを端末内で扱い、過去の情報を探す使い方を示しています。
Android向けには、Googleが今後数週間で「ML Kit」から使えるサービスとしても提供すると予告しています。
公開済みのデモと、これから追加される開発者向け機能は時期が違います。
結論
今回の発表で、スマホ内の検索が一歩進みました。
「EmbeddingGemma 2」の面白さは、写真、動画、音声を、ファイル名ではなく内容から探せることです。
開発者にとっては、その検索をオフラインのアプリへ組み込みやすくなります。
一般の人は、まず「Google AI Edge Gallery」のデモで、手元の動画から一瞬を探す体験を試せます。
ぶっちゃけ、何年分もの動画を「確かあの場面があったはず」で探さなくて済むなら、かなり助かりますよね。
最後に
今回は、Googleの新モデル「EmbeddingGemma 2」についてご紹介しました。
みなさんなら、スマホの写真や動画から、どんな場面を探してみたいですか?
ぜひコメント欄で教えてください。
この動画が参考になった方は、高評価・チャンネル登録をよろしくお願いします。
それでは、また次回の動画でお会いしましょう!