目に見えない都市の構築部分 #3. イベント駆動型 AI エージェントが必要になるまで存在しない空間インターフェイスを作成する方法

これは、Gemini を使用したアプリ内のサービス メッシュとしての分散 A2A ベースのエージェントに関する一連の投稿の 3 番目の投稿です。 一部 1 そして 一部 2 技術的な詳細については.

https://Medium.com/media/fe023eefd7015e97be1d27ad8fdf22f5/href

"お父さん! 消火栓の下に青く光るパイプが見えます. そこに子猫を加えてもいいですか?」

それが拡張現実で私たちの街を見たときの娘たちの最初の反応でした. 3 人の AI エージェントが連携して動作するわけではない. 空間認識オーバーレイを生成する Gemini モデルではありません. 子猫. 彼女は情報で覆われた退屈な舗装を見た, 隠された世界が下に現れるのを見た, そしてすぐに収集品を置きたくなりました. 実際、それは面白いアイデアだと思います.

このすべての始まりとなったスケートボードを思い出してください? 去年の夏に雨水管に落ちたもの? 彼女はついにレントゲン視力を手に入れました. でも今彼女が見ているものは、マンホールの蓋を降りたときに想像していたものよりも大きかった. 彼女はキャンバスを見ている.

そしてそれは AR についての私の考え方を変えました。」

データの投影から現実の処理まで

写真[1]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
Google Glass パイオニア クリスタル – デバイス #1376

バックイン 2014 Glass の発売前ハッカソンに参加するため、ニューヨーク市にある Google のベースキャンプに飛びました. そこで私はパイオニア クリスタルを手に入れました。今でもオフィスの棚にオリジナルの Glass ハードウェアの隣に置かれています。. LynxFitを構築しました, ワークアウトの統計情報を周辺視野に表示する AR フィットネス アプリ. 私たちは未来を開拓していると思っていました. 私たちは実際にその限界を発見しつつありました.

Glass 時代から私が得たものはこれです, そしてそれを明確にするのに何年もかかりました: AR を表示の問題として扱いました. 通知を表示する. プロジェクトの指標. 必要最低限​​の機能を備えたスマートフォンの UI を小さなプリズムに詰め込み、それを空間コンピューティングと呼ぶ. 私がランナーに LynxFit をデモすると、彼らは自分のペースが空中に浮かんでいるのを見て興奮するでしょうが、デジタル アーティファクトが現実世界に真に空間的に固定されることはありませんでした。. 私たちは世界に情報を発信するのに忙しすぎて、世界が米国に何を伝えているのかを決して尋ねることはありませんでした。.

昨年に早送りしてください Android XRの発表.

写真[2]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
カリフォルニア州マウンテンビューで Google の新しい Android XR デバイスをテスト

この AI エージェントの世界では, XR向けアプリを構築するという概念は消えつつある. 仕事はもはや画面用のアプリを構築することではありません. 仕事は、物理的な形状を理解する AI エージェントを調整することです, コンテクスト, あなたが立っている場所の意図も.

https://Medium.com/media/25cef304b503ed18a5e81ac55c441f9c/href

これは予想してたんだけど 10 年以上にわたり、私のスピーカーデッキが XR について語っているのをチェックしてください. データの投影から現実の処理に移行しました. それが全体のシフトです.

すべてを変えた出来事

The Invisible City にモバイル AR を追加することでロックが解除されました. 境界ボックスが本物の消火栓をロックし始め、私がその周りを歩くと追跡し始めたとき, 何かがクリックされた. これは世界に対応する環境知性でした.

写真[3]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
Invisible City スタック/アーキテクチャ

現在ライブモードで実際に実行されているものは次のとおりです:

  1. カメラの動き. 携帯電話からモーション イベントが 30fps で発生します.
  2. Surface Eye の自動検出. 新しいマーカーは WebSocket 経由でストリーミングされます.
  3. パターン Oracle が異常に気づく. 「そのガスラインはただ 18 深さインチ. それは浅いですね。」
  4. デプス レンダラーは赤い警告オーバーレイをペイントします.
  5. Gemini Live が声を上げる. 「現在の位置でガスラインが予測されました。」

誰も「ねえ、AI」とは言いませんでした, これを分析してください。」システムが見ているのは、, 理解します, そしてあなたに言います. 自律的に.

私はこれを通りを歩いてテストしました. ユーティリティマーカー群を越えた瞬間, 声はそれに近いもので聞こえた: *3 つの電力会社がここに集結, 標準深さの水道本管, 通信管がその上を横切っているように見える, 珍しい構成。* (これはシステムが何を伝えるかを示したものです, 逐語的なログではありません. 実際のトランスクリプトはもっと乱雑です。) ポイントは立つ. 尋ねなかった. これは言及する価値があるとわかっただけです.

これは、Glass で構築した AR とは異なる種類の AR です.

街路の透明化

開発者が力を注ぐ瞬間がここにあります. 私たちはジェミニに通りを透明にするように言います, そしてそれが空間的に何を意味するかを理解します.

config = type.GenerateContentConfig(
応答モダリティ=["IMAGE", "TEXT"],
)
応答 = client.aio.models.generate_content を待ちます(
model="gemini-3.1-flash-image-preview",
内容=[
types.Part.from_bytes(データ=画像データ, mime_type="image/jpeg"),
プロンプト
],
構成=構成
)

その設定行は多くの作業を行っています. 同じ呼び出し内で、Gemini に画像を生成し、その理由を説明するよう依頼しています。. 視覚化を作成しています, ピクセルを分類するだけではなく.

プロンプトは動作の起源です:

"transparent": """
致命的: 元の画像を正確に保存する必要があります, を変更するだけです
地面が半透明になる.
説明書:
1. すべての建物を維持する, 車, 人々はありのままに
2. Apply "frosted glass" 舗装/道路にのみ影響します
3. この地表の下で光る地下施設を表示します
4. 線にAPWAカラーを使用する (赤: 電気, 青: 水…)
5. テキストを追加しないでください, ラベル, またはUI要素
"""

双子座は何が地盤で何が地盤でないのかを見分ける, 透明度を選択的に適用します, ユーティリティが埋め込まれているため、上に浮いているのではなく、地球の中にあるように見えます, 奥行きを明らかにしながら遠近感を維持します. 投稿 1 で、Surface Eye がマンホールの蓋とフリスビーを混同し続けたときのことを思い出してください。? その同じモデル ファミリは現在、材料特性と 3D 空間を十分に理解しているため、すべての車や歩行者に影響を与えずに、アスファルトを選択的に透過させることができます。.

Oracle のポスト 2 からの 350 フィートの間隔の計算をパターン化する? 透明なレイヤーの下の正しい深さで光るパイプとしてレンダリングされます。. 3人のエージェントがついに1つのフレームに一緒に登場します.

生成UI: 必要なときだけ存在するインターフェース

娘の子猫のリクエストは、私がまだ言葉にしていなかったことを示していました.

従来のソフトウェアでは, 開発者はすべてのボタンをハードコーディングします, メニュー, 事前にダッシュボードに. UI があなたを待っています. 必要かどうかに関係なく、常にそこにあります.

私たちの AR システムでは、インターフェースは一時的です. 必要になるまで存在しない. 彼女が子猫を求めたとき, 彼女はバックログの機能をリクエストしていませんでした. 彼女は、オンデマンドで自動的に生成されるインターフェースについて説明していました.

コンテキストを分岐する方法の簡略版は次のとおりです。. 実際のシステムはより複雑で、コンテキスト分類子自体がモデル呼び出しです。. これはスケルトンのイラストです:

# 簡略化した図, 完全な実装ではない
async def generated_contextual_interface(
ユーザーコンテキスト: str, # "construction_worker" | "child" | "city_planner"
ライブマーカー: リスト, # Surface Eye からのストリーミング
現在の推論: 辞書, # パターンオラクルより
):
if user_context == "child":
prompt = f"""
AR宝探しインターフェイスを作成する:
- 仮想オブジェクトを近くに隠す {レン(ライブマーカー)} 検出されたマーカー
- 光らせて脈動させて注意を引きつけます
- 発見時にパーティクルエフェクトを追加
"""
elif user_context == "construction_worker":
prompt = f"""
ユーティリティ安全オーバーレイの作成:
- 浅いガスラインを赤で強調表示します
- 必要な掘削クリアランスを表示する
- 画面 811 この場所の通話ステータス
"""
return await gemini.generate_spatial_ui(プロンプト, 現在のシーン)

同じ物理的な通り, まったく異なる生成された現実. 両方をテストしました. 建設作業員は深さの測定と安全ゾーンを確認します. 娘は消火栓の近くで光る収集品を見つけます.

それをヘッドマウント ディスプレイにも拡張します. Android XR メガネをかけている, あなたは街路レベルのジャンクションボックスを見ます, AIはそれを識別するだけではありません. 視線の継続時間に基づいて (あなたはそれを勉強していますか?), あなたの役割 (電気技師が待機中?), とコンテキスト (このブロックで停電が報告されました?), カスタムインターフェイスを生成します: 電圧測定値が表示される診断パネル, メインブレーカーを指す矢印, 空間的に配置された段階的なリセット命令, 公共事業にダイヤルするかどうかを尋ねる音声.

インターフェースは必要になるまで存在しない. 目を離すと消えてしまう. 閉じるメニューはありません. 最小化するウィンドウがありません.

これは私ができなかったことです 2014. Glass では、考えられるすべてのインターフェースを事前に構築する必要がありました. Gemini はオンデマンドでそれらを生成するようになりました.

発送したもの (そして私たちを驚かせたのは)

今日アプリを起動すると実際に何が起こるかは次のとおりです.

リアルタイムナレーション付きライブカメラモード. 「ライブ開始」を押すと、カメラフィードに走査線効果が表示されます。. Surface Eye は 30fps ビデオを処理します, WebSocket を介したストリーミング マーカー. Gemini Live はずっと聞いていて、見たものをナレーションします: *12時に約10フィート先に消火栓が見えます, 青いスプレーペイントは下にある水道本管を示しています, オレンジ色のマークは、この交差点での通信横断を示唆しています。* あなたは尋ねていません. あなたが知りたいと思っているはずです.

ここでの正直な注意点が 1 つあります. ジェミニ 2.5 Live API セッション中の Flash Native Audio Preview のツール呼び出しは、およそ 1 回に 1 回信頼性が低下します。 20 電話. それは GitHubの問題 #843 フォローしたい場合は. 私はそれを回避しています。 ジェミニ CLI ドロップされたツールの呼び出しをキャッチして再実行する、15 秒の並列バックエンド タイマーを実装しました。. セクシーではない. 絶対に必要. 製品版 AR は、これらの「退屈な」信頼性パッチの上で存続し、消滅します。.

4 つの視覚化スタイル, それぞれが同じカメラフレームからレンダリングされます:

写真[4]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
インビジブルシティインターフェース

透明. 舗装が曇りガラスに変わる. 青い水道管が下で光ります, 赤い電線パルス. 地上のものはすべて撮影したとおりに残ります.

写真[5]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
nanobanana エージェントを使用した透明レンダリング

X線. シーン全体がダークブループリントになる. インフラだけが光る. ちょっとブレードランナーに似てる, 携帯電話からライブで生成される.

写真[6]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
nanobanana エージェントを使用した X 線モード

断面図. 私のお気に入り. 誰かが巨大なノコギリを地球に持ち込んで断面をスライスしたように. 土の層が見えます, 砂利のベッド, 実際の深さのパイプ. 建設作業員はすぐにそれを受け取ります.

写真[7]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
nanobanana エージェントを使用した断面図のレンダリング
写真[8]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com

ARオーバーレイ. 歩き回るために構築されたモード. ホログラフィックボックスが本物のマーカーをロックします, 光る線が地下道を繋ぐ, 空中に浮かぶ距離. すべて 30fps で更新されます.

写真[9]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
インビジブルシティARモード
写真[10]-Google Glassの投影データ. Gemini は Windows 7、8、10、11 向けのリアリティを生成します-Winpcsoft.com
Gemini 3.x ライブ API

そして正直に約束したから: 早い段階で, ジェミニは美しく透明な通りを生成します…そこにランダムなキリンが立っています. あるいは、道路も車も透明になります. 特に特別な出力の 1 つは、「空白の中で存続の危機に瀕しているパイプ」としか言いようがありません。そこで、決定的なフォールバック パスを構築しました:

そうでない場合、visualization_base64:
ロガー.情報("Falling back to deterministic compositing")
# ジェミニは失敗しました? 問題ない. 自分たちで描いてください.
Visualization_base64 = create_visualization を待ちます(
surface_image_base64,
表面解析,
ネットワーク推論,
スタイル=スタイル
)

モデルが誤動作する場合、ビジュアライゼーションを従来のグラフィックスと合成します。. ユーザーは失敗に気づくことはありません. このハイブリッドパターン, AI が機能するときは AI、機能しないときは決定的, それはデモと人々が実際に持ち歩くものとを分けるものです.

アンチチャットボット: イベント駆動型エージェント

何かについて直接言わせてください. これはカメラが取り付けられたチャットボットではありません.

私はその方法について暴言を吐いたことで悪名高いです チャットボットは遅延インターフェイスです (ただし、LLM が昔に何ができるかを示すのには役立ちました 2022). それらはすべて同じように機能します: あなたは尋ねます, 彼らは答えます. 豪華なものでも、画像をアップロードして質問を入力するのを待っています.

当社のエージェントはイベント駆動型です. 彼らは世界に応えます, プロンプトを表示しない. ライブ モードの実際の WebSocket ハンドラーは次のとおりです。:

onToolCall: ({ 名前, 引数 }) => {
もし (name === "surface_eye_analysis") {
// エージェントが何かを検出しました, ユーザープロンプトは必要ありません
const マーカー = args.marks;
更新ARオーバーレイ(マーカー);
もし (異常があります(マーカー)) {
話す警告("Unusual configuration detected");
}
}
}

ユーザーは「何が見えますか」と尋ねているわけではありません。?」 エージェントは継続的に処理を行っています, 推測する, そして警告.

これはどこへ行くのか

娘は子猫モードを望んでいます. 彼女の遊び心のあるアイデアは重大なことを指している.

今作っているもの, いつかではない. 同じ通りを向いた 2 台の携帯電話で同じ生成されたオーバーレイが表示されるマルチユーザー AR セッション, 同じエージェント クラスターからの共有空間状態に基づく. Gemini Live を介した音声ファーストのインタラクションにより、インタラクション モデルは単純な会話になります。. ヘッドマウント ディスプレイのオンデバイス パターン Oracle 推論, クラウドの往復により 100 ミリ秒以内にプレゼンスが失われるため.

前提全体を再考させられた部分. 私たちは AR を「現実に追加するもの」として捉え続けています。ずっと逆だったらどうなるか? 現実がデフォルトの UI だったらどうなるか, AR を使用すると、その上にさらに優れたものを生成できます?

街路は交通手段のUI. 壁は空間分割のためのUIです. ドアはアクセス制御のための UI です. 建築家やエンジニアは何十年、何世紀も前にこれらのインターフェースを設計しましたが、私たちはそれらに固執してきました。. 古いインターフェイス上に新しいインターフェイスをリアルタイムで生成できるようになりました, 誰が見てもパーソナライズされた.

外科医が臓器の上にバイタルが浮いているのを確認, 有線センサーではなく、肌の色の変化と胸の動きから推測. シェフは鍋の上にタイマーを、フライパンの上に温度勾配を見ます, 食材やカウンター上の道具から生み出される. 娘は、仮想の子猫が本物の消火栓の近くに隠れる宝探しを目撃します, 天候に応じてゲームの生成は毎回異なります, 時刻, Surface Eye が検出するマーカー. ゲームは私たちが作ったものではありません. それはシステムが構築するものです, その場で, 物理世界をキャンバスとして.

スタック

これは実行されます:

  • Gemini ライブ API 音声ファーストの AR インタラクション用 (ディープマインド)
    Vertex AI エージェント エンジン 3 つのエージェントを大規模に調整する
    Googleクラウドラン 低遅延のエッジ展開向け
  • 将来…
    アンドロイドXR 空間コンピューティングの基盤として

詩を書くのと同じ Gemini モデルが空間認識 AR オーバーレイを生成しています. チャットボットを駆動するのと同じエージェント エンジンがリアルタイム ビジョン システムを調整しています. 処理する API から、認識するエージェントに移行しました。.

あなたの番です

Invisible City は雨水管に置かれたスケートボードから始まりました. 道路を透明にするシステムになりました. それが始まりです, 終わりではない.

娘は、他の子供たちが見つけられるように、仮想の子猫をパイプの中に隠したいと考えています。. 彼女はすでにパワーアップを設計しており、近くにある公共施設に基づいて子猫を異なる色に光らせるかどうかを議論しています。. (そうすべきです。)

建設作業員は単に掘削しても安全なものを確認したいだけではありません. シャベルを手に取る前に AI に警告してもらいたい: マークされたガス管への近さと現在の風の状況に基づいて, 北からのアプローチ.

都市計画者はインフラ容量のダッシュボードだけを望んでいるわけではありません. 彼らは人間が見落とすパターンを望んでいます: この地域の水使用量はピークに達している 30 周囲よりも数分早い, パイプの応力インジケーターは、パイプの破損が予測される前にこのセクションをアップグレードすることを提案しています。 18 月.

それで、これが私の本当の質問です. 誰が見ているかに基づいてインターフェイスが自動的に生成される場合、何を構築しますか? あなたの子猫モードは何ですか…遊び心, 実用的, または、モデルが代わりに描画してくれる場合は、現実の上に重ねて表示する重厚なオーバーレイも可能です。?

コードは本物です. プラットフォームはここにあります. モデルの準備ができました. 私の娘はすでに機能リストを持っています.

何か違うものを作りましょう…重要なものを.

— –

シリーズの次回は、5 月に何にアクセスできるかによって決まりますが、これを実際の AI メガネにデプロイする旅になることを願っています, 乞うご期待.

Noble は、AI/ML の Google 開発者エキスパートであり、米国の Glass パイオニアです。 2014 ニューヨーク市ベースキャンプハッカソン, 現在、AI エージェントが見ることができるようになると何が起こるかに夢中になっています。, についての理由, リアルタイムで空間インターフェースを生成します. おそらく今、彼の路上で AR 機能をテストしているでしょう, 近所の人たちを大いに混乱させた.

シリーズの 1 つと 2 つを投稿します: Gemini を使用したビジョンを活用したインフラストラクチャ検出エージェントの構築 3 · ドメイン知識を使用した A2A 検出可能な推論エージェントの構築

旅をたどる: YouTube: ノーブル・アッカーソン

blank


Google Glassの投影データ. Gemini Generates Reality はもともと Google Developer Experts on Medium で公開されました, 人々がこのストーリーをハイライトして応答することで会話を続けている場所.