by Mario Chow & Figo @IOSG
はじめに
ウェブブラウザと自動化の関係は、過去12ヶ月で劇的に変化しました。
ウェブブラウザとオートメーションの関係は、過去12ヶ月で劇的に変化しました。ほぼすべての主要なハイテク企業が、自律的なブラウザ・エージェントを構築しようと躍起になっています。OpenAIは1月にエージェントモードを導入し、Anthropicはクロードモデルの「Computer Usage」をリリースし、Google DeepMindは ウェブブラウザ用のエージェントモードを開始しました。Project Mariner、Operaはエージェントベースのブラウザ Neonとを発表した。leaf="">、そしてPerplexity AIは Comet Browserを発表した。AIの未来は、自分でウェブをナビゲートできるエージェントにあります。
このトレンドは、より賢いチャットボットをブラウザに追加することだけではありません。ブラウザー エージェントは、ウェブページを「見て」、リンクをクリックしたり、フォームに入力したり、ページをスクロールしたり、テキストを入力したりと、人間のユーザーと同じように行動できる AI システムの一種です。人間のユーザーのように。このモデルは、現在まだ人間の介入が必要なタスクや、従来のスクリプトでは複雑すぎるタスクを自動化することで、莫大な生産性と経済的価値を解き放つことを約束する。

▲ GIFデモ。"">▲GIFデモ:AIブラウザエージェントの動作:指示に従って、ターゲットデータセットのページに移動し、自動的にスクリーンショットを撮り、必要なデータを抽出します。
AIブラウザの戦いに勝つのは誰か?
ほぼすべての大手テック企業(および少数の新興企業)が、独自のブラウザAIエージェント・ソリューションに取り組んでいます。
オープンAI - エージェント モード
OpenAIのエージェントモード(旧称Operator、2025年1月開始)は、自己完結型のブラウザベースのAIエージェントで、ウェブフォームへの入力、食料品の注文、会議のスケジュール設定など、幅広い反復的なオンラインタスクを処理します。すべて人間が使う標準的なウェブインターフェースを介して。

▲ AIエージェントがスケジュールを立てる。"">▲ AIエージェントはプロのアシスタントのように会議をスケジュールします:カレンダーをチェックし、利用可能な時間帯を見つけ、イベントを作成し、確認を送信し、 .ics ファイルを生成します。
アンソロピック - クロードの「コンピュータ使用」:
アンソロピック - クロードの「コンピュータ使用」:
2024年末、Anthropicはクロード3.5に新しい「コンピューター使用」機能を導入しました。「claudeは画面を見たり、カーソルを動かしたり、ボタンをクリックしたり、テキストを入力したりすることができます。これは、この種のビッグモデルエージェントツールとしては初のパブリックベータ版であり、開発者はクロードにウェブサイトやアプリのナビゲーションを自動化させることができる。anthropicはこれを、ウェブ上のマルチステップワークフローを自動化することを主目的とした実験的な機能と位置づけている。

Perplexity - Comet
AIスタートアップのPerplexity(クイズエンジンで知られる)は、2025年半ばにCometブラウザを発表した。Perplexity(Q&Aエンジンで知られる)は、Chromeに代わるAI搭載のブラウザとして2025年半ばにCometを発表した。Cometの中核にあるのは、オムニボックスに組み込まれた会話型AI検索エンジンで、従来の検索リンクの代わりにQ&Aと要約を即座に提供する。

- さらに、コメットには、内蔵の コメット・アシスタントがあります。サイドバーに常駐し、サイト間のルーチン・タスクを自動化するエージェントです。たとえば、開いているメールを要約したり、ミーティングをスケジュールしたり、ブラウザのタブを管理したり、あなたの代わりにウェブをブラウズして情報をクロールしたりすることができます。

エージェントがサイドバーのインターフェイスを通じて現在のウェブページの内容を感知できるようにすることで、CometはブラウジングとAIアシスタントをシームレスに統合することを目指しています。前回の記事では、主要な技術企業(OpenAI、Anthropic、Perplexityなど)が、さまざまな製品形態を通じて、ブラウザエージェントにどのように機能を吹き込んでいるかをレビューしました。その価値をより直感的に理解するために、これらの機能が実際のシナリオで、日常生活や企業のワークフローでどのように使用されているかを詳しく見てみましょう。
日常的なWebオートメーション
非常に実用的なシナリオは、ショッピングや予約タスクをエージェントに委任することです。エージェントは、オンラインショッピングカートに自動的に入力し、固定リストに基づいて注文を行うこともできますし、複数の小売店から最安値を探し出し、あなたに代わってチェックアウトプロセスを完了することもできます。

旅行の場合、AIに次のようなタスクの実行を依頼することができます。"来月の東京行きのフライトを予約してください(料金は800ドル以下)。航空券の検索、オプションの比較、乗客情報の入力、ホテルの予約完了など、すべてのプロセスを航空会社やホテルのウェブサイトを通じてエージェントが処理することになる。このレベルの自動化は、既存の旅行ボットを遥かに凌ぐものだ。単に勧めるだけでなく、購入を直接実行する。
オフィスの生産性を高める
エージェントは次のことができます。人がブラウザで行う反復的なビジネス操作の多くを自動化できます。例えば、電子メールを整理してToDoリストを引き出したり、複数のカレンダーの空き状況をチェックしてミーティングを自動的にスケジューリングしたりすることができる。perplexityのCometアシスタントは、すでにウェブインターフェイスを通じて受信トレイの内容を要約したり、スケジュールを追加したりすることができる。エージェントはまた、SaaSツールにログインして、定期的なレポートを作成したり、スプレッドシートを更新したり、あなたの承認を得てフォームを送信したりすることもできる。様々な求人サイトに自動的にログインして求人情報を掲載できる人事エージェントや、CRMシステムのリードデータを更新できる営業エージェントを想像してみてください。このような日々の雑用には多くの従業員の時間がかかりますが、AIはウェブフォームやページのアクションを自動化することで、このような雑用をこなすことができます。

単一のタスクに加え、エージェントは複数のネットワークシステムにわたって完全なワークフローをひもづけることができます。これらのステップはすべて別々のウェブインタフェースで実行する必要があり、これがブラウザエージェントの強みです。エージェントは、トラブルシューティングのために様々なダッシュボードにログインすることができ、新入社員のオンボーディング(複数の SaaS サイトのアカウント作成)のようなプロセスをオーケストレーションすることもできます。基本的に、現在複数のウェブサイトをクリックする必要があるマルチステップのアクションは、エージェントによって実行できます。
現在の課題と限界
。潜在的な可能性にもかかわらず、今日のブラウザエージェントはまだ完璧にはほど遠いものです。
アーキテクチャの不一致
アーキテクチャの不一致
現代のウェブは人間が操作するブラウザのために設計され、自動化に積極的に抵抗するように時間をかけて進化してきました。データは多くの場合、視覚的な表示に最適化されたHTML/CSSに埋もれ、インタラクションのジェスチャー(マウスホバー、スワイプ)によって制限され、あるいは非公開のAPIを通じてのみアクセス可能です。
クローラー対策や不正防止システムは、この上にさらに人工的に障壁を追加します。これらのツールは、IPレピュテーション、ブラウザのフィンガープリンティング、JavaScriptのチャレンジ・フィードバック、行動分析(マウスの動きのランダム性、タイピングの拍子、滞在時間など)を組み合わせています。逆説的だが、AIエージェントが "完璧 "で効率的であればあるほど、例えばフォームに即座に入力し、決してミスを犯さないようなものであればあるほど、悪意のあるオートメーションとして識別される可能性が高くなる。例えば、OpenAIやGoogleのエージェントは、チェックアウト前のすべてのステップを滞りなく完了するかもしれませんが、CAPTCHAや二次的なセキュリティフィルターによってブロックされてしまいます。

人間に最適化されたインターフェースに、ロボットに不親切な防御層を重ねることで、エージェントは脆弱な「人間-機械模倣」戦略を取らざるを得なくなります。このアプローチは非常に脆弱であり、成功率も低い(人間の介入なしでも、完全なトランザクションの3分の1以下しか完了しない)。
信頼とセキュリティの懸念
エージェントを完全に制御するには、機密データにアクセスする必要があります。完全な制御を得るためには、ログイン認証情報、クッキー、二要素認証トークン、さらには支払い情報など、機密情報へのアクセスが必要になることがよくあります。
これらのリスクに基づいて、現在のシステムは一般的に慎重なアプローチをとっています。グーグルのマリナーは、クレジットカード情報を入力したり、利用規約に同意したりせず、ユーザーに情報を返します。
OpenAIのOperatorは、ログインやCAPTCHAのチャレンジを引き継ぐようユーザーに促します。

その結果、AIと人間の間で頻繁に休止やハンドオフが発生し、シームレスな自動化のエクスペリエンスが弱まります。
このようなハードルがあるにもかかわらず、OpenAI、Google、Anthropicなどの企業は、繰り返すたびに失敗から学びながら、進歩を続けています。需要が高まるにつれ、"共進化 "が起こりそうだ。ウェブサイトは好ましいシナリオではエージェントフレンドリーになり、エージェントは既存の障壁を迂回するために人間の行動を模倣する能力を向上させ続けるだろう。
アプローチと機会
現在、ブラウザプロキシは2つの異なるアプローチに直面しています。一方は、どこにでもあるクローラー対策やセキュリティ防御を備えた Web2という敵対的な環境であり、もう一方は、自動化がしばしば奨励されるWeb3のオープンな環境です。が推奨されることが多い。この違いは、それぞれのタイプのソリューションの方向性を決定づけます。
以下のソリューションは、2つの大きなカテゴリに分類されます:Web2の敵対的な環境を迂回するエージェントを支援するものと、Web3のネイティブなものです。
ブラウザプロキシが直面している課題は依然として重大ですが、それに直接対処しようとする新しいプロジェクトが出現しています。暗号通貨と分散型金融(DeFi)のエコシステムは、オープンで、プログラム可能で、自動化に対する敵対心が低いため、自然なテスト場になりつつあります。オープンAPI、スマートコントラクト、オンチェーンの透明性は、Web2の世界に共通する摩擦点の多くを取り除きます。
以下は4つのソリューションのカテゴリーで、それぞれが今日の中核的な制限の1つ以上に対処しています。span leaf="">オンチェーン操作のためのネイティブプロキシベースのブラウザ
これらのブラウザは、自律的なプロキシ駆動となるようにゼロから設計されており、ブロックチェーン・プロトコルと深く統合されています。オンチェーン操作を自動化するためにSelenium、Playwright、またはウォレットプラグインへの追加依存を必要とする従来のChromeとは異なり、ネイティブエージェントベースのブラウザは、エージェントが呼び出すためのAPIと信頼された実行パスを直接提供します。
分散型金融では、トランザクションの有効性は、ユーザーが「人間的」かどうかではなく、暗号署名に依存します。したがって、オンチェーン環境では、プロキシはCAPTCHA、詐欺検出スコア、そしてWeb2の世界で一般的なデバイスフィンガープリントチェックをバイパスすることができます。しかし、これらのブラウザがAmazonのようなWeb2サイトに誘導された場合、関連する防御メカニズムをバイパスすることはできず、通常のボット対策はそのシナリオでもトリガーされます。
プロキシ ブラウザの価値は、魔法のようにすべてのWebサイトにアクセスできるということではありません。
ブロックチェーンのネイティブな統合
自動化優先設計
自動化優先設計
自動化優先設計: プロトコル操作に直接マッピングできる安定した高レベル命令を提供します。
セキュリティモデル:きめ細かな特権制御とサンドボックスにより、自動化中の秘密鍵の安全性を保証します。
パフォーマンスの最適化: ブラウザのレンダリングやUIの遅延なしに、複数の連鎖した呼び出しを並行して実行できます。
代表的な例: ドーナツ
Donutはブロックチェーンのデータを一級市民として業務に統合しています。ユーザー(またはその代理人)は、ホバーしてトークンのリアルタイムのリスクメトリクスを見たり、「/swap 100 USDC to SOL」のような自然言語コマンドを直接入力したりできる。Web2の敵対的な摩擦点をスキップすることで、DonutはエージェントをDeFiでフルスピードで実行することを可能にし、流動性、裁定取引、市場効率を向上させる。
検証可能で信頼できるエージェントの実行
エージェントに機密特権へのアクセスを与えるリスクは高い。プロキシに機密特権を取得させることは危険です。関連するソリューションは、信頼された実行環境(TEE) またはゼロ知識証明(ZKP)を使用します。実行前にエージェントの意図した動作を暗号的に確認することで、ユーザーと取引相手は秘密鍵や認証情報を明かすことなくエージェントの動作を検証することができます。
例:ファラネットワーク
Phalaは、Intel SGXなどのTEEを使用して、Phalaオペレータや攻撃者によるエージェントロジックやデータの覗き見や改ざんから実行環境を分離し、保護します。TEEはハードウェア対応の「セーフルーム」として機能し、機密性(外部から見えない)と完全性(外部から変更できない)を保証します。
ブラウザー エージェントにとって、これはログイン、セッション トークンの保持、または支払い情報の処理が可能であることを意味し、この機密データが安全な部屋から出ることはありません。ユーザーのマシン、オペレーティング システム、またはネットワークが侵害されたとしても、侵害されることはありません。これは、エージェントアプリを軌道に乗せるための最大の障壁の1つである、機密性の高いクレデンシャルと操作に対する信頼の問題を直接軽減します。
分散型構造化データネットワーク
IPレピュテーション、ブラウザフィンガープリンティング、JavaScript チャレンジ フィードバックおよび行動分析 (カーソルの動き、タイピングのリズム、セッション履歴など)。データセンターのIPや完全に反復可能なブラウジング環境に由来するプロキシは、簡単に識別できます。
この問題を解決するために、人間用に最適化されたウェブページをクロールする代わりに、この種のネットワークは機械が読めるデータを収集し、提供します。strong>あるいは、実際の人間のブラウジング環境を通してトラフィックをプロキシします。このアプローチは、従来のクローラの脆弱性である解析やカウンタークローリングを回避し、よりクリーンで信頼性の高い入力をプロキシに提供します。
これらの実世界のセッションにトラフィックをプロキシすることで、配信ネットワークは、AIエージェントがすぐにブロックをトリガーすることなく、あたかも人間のようにウェブコンテンツにアクセスすることを可能にします。
#
ケース・イン・ポイント。
草:ユーザーが未使用の家庭用ブロードバンドを共有する分散型データ/DePINネットワークで、エージェントフレンドリーで地理的に多様な公共ウェブデータ収集とモデルトレーニングへのアクセスを提供する。
WootzApp:バックエンドエージェントと暗号通貨決済をサポートするオープンソースのモバイルブラウザ。AI/データタスクを消費者に「ゲーミフィケーション」する。
Sixpence:貢献者のグローバルネットワークによって支えられているブラウザの分散ネットワーク。ブラウジング、AIエージェントにトラフィックをルーティングする。
しかし、これは完全な解決策ではありません。行動検知(マウス/スクロールトラック)、アカウントレベルの制限(KYC、アカウントの年齢)、フィンガープリントの一貫性チェックは、依然としてブロッキングの引き金となる可能性があります。そのため、分散型ネットワークは、最も効果的であるためには、人間を模倣した実行戦略と組み合わせる必要がある、基礎となるステルス層として捉えるのが最善です。
最新指向のWeb標準(前向き)
現在、ますます多くの技術コミュニティや組織が次のことを探求しています:ウェブユーザーの未来が人だけでなく、自動化されたエージェント(agent)であるならば、ウェブサイトはどのように安全に、そしてコンプライアンスに対応できるのか?
このため、現在のようにエージェントをデフォルトで「ボット攻撃者」として扱うのではなく、Webサイトが「信頼できるエージェントのアクセスを許可する」と明示し、やり取りを完了するための安全なチャネルを提供できるようにするための、新たな標準やメカニズムに関する議論が活発化しています。プロキシは、現在のようにデフォルトで「ボット攻撃」としてブロックされます。
「エージェントは許可されています。「タグ:検索エンジンが準拠するrobots.txtのように、将来、ウェブページは、「ここを訪問しても安全です」とブラウザエージェントに伝えるタグをコードに含めるかもしれません。たとえば、プロキシを使用してフライトを予約する場合、CAPTCHAを大量に表示する代わりに、サイトは認証されたインターフェイスを提供するだけになります。
認証済みプロキシ用のAPPゲートウェイ:サイトは、認証済みプロキシ専用のポータルを開くことができます。「Fast Track」のようなものです。人間のクリックや入力をエミュレートする代わりに、エージェントは注文、支払い、またはデータクエリを完了するために、より安定したAPIパスを取ります。
W3Cの議論:ワールド・ワイド・ウェブ・コンソーシアム(W3C)は、標準化された「管理された自動化」を開発するために、新しいAPIを作成する方法をすでに検討しています。標準化されたチャンネルを開発するために、「管理された自動化」のための新しいAPIを作成する方法をすでに検討しています。これは、将来的に、信頼できるエージェントが安全で説明責任を果たしながら、Webサイトによって認識され受け入れられるようにする、世界的に適用可能なルールセットができる可能性があることを意味します。
これらの研究はまだ始まったばかりですが、ひとたび軌道に乗れば、人間↔プロキシ↔ウェブサイトの関係を劇的に改善する可能性があります。想像してみてください: 風を「欺く」ために必死で人間のマウスの動きを模倣しようとするプロキシはもう必要なく、代わりに「公式に認可された」チャンネルを通して、誠実にタスクを完了するのです。
暗号ネイティブのインフラは、このルートに沿って進む最初のものかもしれません。>.オンチェーン・アプリケーションは本質的にオープンAPIとスマート・コントラクトに依存しているため、自動化に適している。対照的に、従来のWeb2プラットフォームは、特に広告や不正防止システムに依存する企業など、慎重な守りを続ける可能性が高い。しかし、ユーザーや企業が自動化による効率化を受け入れるにつれ、こうした標準化の試みは、インターネットをエージェント・ファーストのアーキテクチャへと移行させる重要なきっかけとなりそうだ。
結論
ブラウザエージェントは、単純な会話ツールから進化しています。単純な会話ツールから、複雑なオンラインワークフローに対応できる自律的なシステムへと進化しています。このシフトは、ユーザーがインターネットとやりとりするために使用するコアインターフェイスに直接自動化を埋め込むという、より広範なトレンドを反映しています。生産性を向上させる可能性は非常に大きいですが、定着したアンチボット・メカニズムをどのように突破するか、セキュリティ、信頼、責任ある使用をどのように確保するかなど、課題も同様に大変なものです。
短期的には、エージェントの推論能力の向上、高速化、既存のサービスとの緊密な統合、分散ネットワークの進歩により、信頼性が段階的に向上する可能性があります。長期的には、自動化がサービス・プロバイダーとユーザーの双方にとって有益なシナリオにおいて、「エージェント・フレンドリー」な標準が徐々に採用されるようになるかもしれない。DeFiのような自動化フレンドリーな環境では採用が早まり、ユーザーとの対話制御に大きく依存するWeb2プラットフォームでは採用が遅れるでしょう。
今後のテクノロジー企業間の競争では、エージェントが現実世界の制約をいかにうまく切り抜け、重要なワークフローに安全に統合し、多様なオンライン環境で一貫して結果を出せるかがますます重視されるようになるでしょう。.このすべてが最終的に「ブラウザ戦争」を再編成するかどうかは、技術力だけでなく、信頼を築き、インセンティブを調整し、日常的な使用において真の価値を実証できるかどうかにかかっている。