작성자: Mario Chow & Figo @IOSG
소개
웹 브라우저와 자동화의 관계는 지난 12개월 동안 극적으로 변화했습니다. 거의 모든 주요 기술 기업들이 자율 브라우저 에이전트를 구축하기 위해 분주하게 움직이고 있습니다. 이러한 추세는 2024년 말부터 더욱 뚜렷해졌습니다. OpenAI는 1월에 에이전트 모드를 도입했고, Anthropic은 Claude 모델용 '컴퓨터 사용'을 출시했으며, Google DeepMind는 웹 브라우저용 에이전트 모드를 출시했습니다. 프로젝트 마리너, Opera는 에이전트 기반 브라우저 네온과 을 발표했습니다. leaf="">, Perplexity AI는 Comet Browser를 소개했습니다. AI의 미래는 스스로 웹을 탐색할 수 있는 에이전트에 있다는 신호는 분명합니다.
이러한 트렌드는 단순히 브라우저에 더 똑똑한 챗봇을 추가하는 것이 아니라 기계가 디지털 환경과 상호작용하는 방식에 근본적인 변화를 가져오는 것입니다. 브라우저 에이전트는 인간 사용자처럼 웹 페이지를 '보고' 링크를 클릭하고, 양식을 작성하고, 페이지를 스크롤하고, 텍스트를 입력하는 등의 작업을 수행할 수 있는 일종의 AI 시스템입니다. 인간 사용자. 이 모델은 현재 여전히 사람의 개입이 필요하거나 기존 스크립팅으로는 너무 복잡한 작업을 자동화함으로써 엄청난 생산성과 경제적 가치를 실현할 수 있습니다.

▲ GIF 데모: 작동 중인 AI 브라우저 에이전트: 지침에 따라 대상 데이터 세트 페이지로 이동하여 자동으로 스크린샷을 찍고 필요한 데이터를 추출합니다.
AI 브라우저 배틀에서 누가 승리할까요?
거의 모든 대기업과 몇몇 스타트업이 자체 브라우저 AI 에이전트 솔루션을 개발하고 있습니다. 다음은 가장 대표적인 몇 가지 예입니다.
OpenAI - 에이전트 모드
OpenAI의 에이전트 모드(구 오퍼레이터, 2025년 1월 출시)는 웹 양식 작성, 식료품 주문, 회의 예약 등 다양한 반복적인 온라인 작업을 처리하는 독립적인 브라우저 기반 AI 에이전트로, 사람이 일반적으로 사용하는 표준 웹 인터페이스를 통해 처리합니다. 인간이 사용하는 표준 웹 인터페이스를 통해 모두 가능합니다.

▲ AI 에이전트가 전문 비서처럼 미팅을 예약합니다: 캘린더 확인, 사용 가능한 시간대 찾기, 이벤트 생성, 확인 전송, .ics 파일 생성.
인류학 - 클로드의 "컴퓨터 사용":
인류학 - 클로드의 "컴퓨터 사용":
2024년 말, Anthropic은 Claude 3.5에 새로운 '컴퓨터 사용' 기능을 도입했습니다. "이 기능을 통해 클로드는 사람처럼 컴퓨터와 브라우저를 조작할 수 있게 되었으며, 화면을 보고, 커서를 움직이고, 버튼을 클릭하고, 텍스트를 입력할 수 있게 되었습니다. 이 기능은 공개 베타 버전에 들어간 최초의 대규모 에이전트 도구로, 개발자는 Claude를 통해 웹사이트와 앱의 탐색을 자동화할 수 있습니다. anthropic은 웹에서 다단계 워크플로우를 자동화하는 것을 주요 목표로 실험적인 기능으로 포지셔닝하고 있습니다.

< span leaf="">퍼플렉시티 - 코멧
퀴즈 엔진으로 유명한 AI 스타트업 Perplexity는 2015년 중반에 코멧 브라우저를 출시했습니다. Perplexity(Q&A 엔진으로 유명한)는 2015년 중반에 Chrome을 대체하는 AI 기반 브라우저로 Comet을 출시했으며, Comet의 핵심은 기존 검색 링크 대신 즉각적인 Q&A와 요약을 제공하는 대화형 AI 검색 엔진을 옴니박스에 내장하고 있습니다.

또한 Comet에는 내장된 <Comet Assistant가 있습니다. 사이드바에 상주하며 사이트 전반의 일상적인 작업을 자동화하는 에이전트입니다. 예를 들어, 열려 있는 이메일을 요약하고, 미팅을 예약하고, 브라우저 탭을 관리하거나, 사용자를 대신하여 웹에서 정보를 검색하고 크롤링할 수 있습니다.

브라우저 에이전트를 위한 실제 시나리오
이전 글에서는 주요 기술 기업(OpenAI, Anthropic, Perplexity 등)이 다양한 제품 형식을 통해 브라우저 에이전트에 기능을 주입하는 방법을 살펴봤습니다. 이러한 기능의 가치를 보다 직관적으로 이해하기 위해 실제 시나리오, 일상 생활 및 기업 워크플로우에서 이러한 기능이 어떻게 사용되고 있는지 자세히 살펴봅시다.
일상적인 웹 자동화
매우 실용적인 시나리오는 쇼핑 및 예약 작업을 상담원에게 위임하는 것입니다. 상담원이 자동으로 온라인 장바구니를 채우고 정해진 목록에 따라 주문하거나 여러 소매업체에서 최저가를 찾아서 대신 결제 프로세스를 완료할 수 있습니다.

여행의 경우, "다음 달 도쿄행 항공편(요금 800달러 미만)을 예약하고 무료 Wi-Fi가 제공되는 호텔을 예약해 주세요."와 같은 작업을 AI에게 요청할 수 있습니다. 에이전트는 항공사와 호텔 웹사이트를 통해 항공편 검색, 옵션 비교, 승객 정보 입력, 호텔 예약 완료 등 전체 프로세스를 처리합니다. 이러한 수준의 자동화는 기존의 여행 봇을 훨씬 뛰어넘는 것으로, 단순히 추천에 그치지 않고 직접 구매까지 실행합니다.
사무실 생산성 향상
상담원은 다음을 수행할 수 있습니다. 사람들이 브라우저에서 수행하는 많은 반복적인 비즈니스 작업을 자동화할 수 있습니다. 예를 들어, 이메일을 분류하고 할 일 목록을 가져오거나 여러 캘린더에서 열려 있는 일정을 확인하고 자동으로 회의 일정을 예약하는 등의 작업을 수행할 수 있습니다. 퍼플렉시티의 Comet 어시스턴트는 이미 받은 편지함의 내용을 요약하거나 웹 인터페이스를 통해 일정을 추가할 수 있습니다. 또한 상담원은 SaaS 도구에 로그인하여 일상적인 보고서를 생성하거나, 스프레드시트를 업데이트하거나, 사용자의 승인을 받아 양식을 제출할 수도 있습니다. HR 상담원이 여러 구인 게시판에 자동으로 로그인하여 채용 공고를 게시하거나 영업 상담원이 CRM 시스템에서 리드 데이터를 업데이트할 수 있다고 상상해 보세요. 이러한 일상적인 업무는 직원의 시간이 많이 소요되지만, AI는 웹 양식과 페이지 작업을 자동화하여 이러한 업무를 수행할 수 있습니다.

상담원은 단일 작업 외에도 네트워크로 연결된 여러 시스템에서 전체 워크플로우를 연결할 수 있습니다. 이러한 모든 단계는 별도의 웹 인터페이스에서 수행해야 하는데, 이것이 바로 브라우저 에이전트의 강점입니다. 에이전트는 다양한 대시보드에 로그인하여 문제를 해결하고 신규 직원 온보딩(여러 SaaS 사이트에서 계정 만들기)과 같은 프로세스를 조율할 수도 있습니다. 기본적으로 현재 여러 웹사이트를 클릭해야 하는 모든 다단계 작업을 에이전트가 수행할 수 있습니다.
현재 당면 과제와 한계
잠재력에도 불구하고 오늘날의 브라우저 에이전트는 아직 완벽하지 않습니다. 현재 구현을 살펴보면 몇 가지 오랜 기술 및 인프라 문제가 드러납니다.
아키텍처 불일치
구조적 불일치
최신 웹은 사람이 조작하는 브라우저를 위해 설계되었으며 시간이 지남에 따라 자동화에 적극적으로 저항하도록 진화해 왔습니다. 데이터는 시각적 표현에 최적화된 HTML/CSS에 묻혀 있거나, 상호작용 제스처(마우스 호버, 스와이프)에 의해 제한되거나, 공개되지 않은 API를 통해서만 액세스할 수 있는 경우가 많습니다.
크롤러 방지 및 사기 방지 시스템은 여기에 인위적으로 장벽을 추가합니다. 이러한 도구는 IP 평판, 브라우저 핑거프린팅, JavaScript 챌린지 피드백, 행동 분석(예: 마우스 움직임의 무작위성, 타이핑 케이던스, 체류 시간)을 결합합니다. 역설적이게도 AI 에이전트가 양식을 즉시 작성하고 실수를 하지 않는 등 "완벽"하고 효율적일수록 악성 자동화로 식별될 가능성이 높아집니다. 예를 들어, OpenAI 또는 Google 에이전트는 결제 전 모든 단계를 문제없이 완료하지만 결국 CAPTCHA 또는 보조 보안 필터에 의해 차단될 수 있습니다.

인간에게 최적화된 인터페이스와 로봇에 비우호적인 방어 계층이 겹쳐지면 에이전트는 취약한 '인간-기계 모방' 전략을 채택하게 됩니다. 이 접근 방식은 매우 취약하고 성공률이 낮습니다(사람의 개입 없이는 전체 거래의 3분의 1 미만이 완료됨).
신뢰 및 보안 문제
에이전트에 대한 완전한 제어권을 얻으려면 종종 민감한 데이터에 대한 액세스가 필요합니다. 완전한 제어권을 얻으려면 로그인 자격 증명, 쿠키, 2단계 인증 토큰, 심지어 결제 정보 등 민감한 정보에 대한 액세스가 필요한 경우가 많습니다. 이로 인해 사용자와 기업 모두 다음과 같은 우려가 제기됩니다.
이러한 위험에 따라 현재 시스템은 일반적으로 신중한 접근 방식을 취합니다.

그 결과 AI와 사람 간의 잦은 일시 중지 및 핸드오프가 발생하여 원활한 자동화 경험이 약화됩니다.
이러한 장애물에도 불구하고 OpenAI, Google, Anthropic 등의 기업은 반복되는 실패를 통해 학습하면서 빠른 속도로 발전을 거듭하고 있습니다. 수요가 증가함에 따라 웹사이트는 유리한 시나리오에서 더욱 에이전트 친화적으로 변하고 에이전트는 기존의 장벽을 우회하기 위해 인간의 행동을 모방하는 능력을 지속적으로 향상시키는 '공진화'가 이루어질 것입니다.
접근 방식과 기회
현재 브라우저 프록시는 매우 다른 두 가지 접근 방식에 직면해 있습니다. 브라우저 프록시는 한편으로는 유비쿼터스 안티 크롤러와 보안 방어를 갖춘 Web2의 적대적인 환경과 다른 한편으로는 자동화가 종종 권장되는 Web3의 개방적인 환경이라는 매우 다른 두 가지 현실에 직면하고 있습니다. 가 권장되는 경우가 많습니다. 이러한 차이가 각 유형의 솔루션의 방향을 결정합니다.
다음 솔루션은 크게 두 가지 범주로 나뉘는데, 상담원이 Web2의 적대적인 환경을 우회하도록 돕는 솔루션과 Web3에 기본으로 제공되는 솔루션이 그것입니다.
브라우저 프록시가 직면한 문제는 여전히 심각하지만, 이를 직접 해결하려는 새로운 프로젝트가 등장하고 있습니다. 암호화폐와 탈중앙화 금융(DeFi) 생태계는 개방적이고 프로그래밍이 가능하며 자동화에 덜 적대적이기 때문에 자연스러운 시험대가 되고 있습니다. . 오픈 API, 스마트 컨트랙트, 온체인 투명성은 웹2.0 세계에서 흔히 발생하는 많은 마찰점을 제거합니다.
오늘날의 핵심적인 한계를 하나 이상 해결하는 네 가지 범주의 솔루션이 있습니다:
< span leaf="">온체인 운영을 위한 네이티브 프록시 기반 브라우저
이 브라우저는 처음부터 자율 프록시 중심으로 설계되었으며 블록체인 프로토콜과 긴밀하게 통합되어 있습니다. 온체인 작업을 자동화하기 위해 셀레늄, 플레이라이트 또는 지갑 플러그인에 대한 추가 종속성이 필요한 기존 크롬과 달리, 네이티브 에이전트 기반 브라우저는 에이전트가 호출할 수 있는 API와 신뢰할 수 있는 실행 경로를 직접 제공합니다.
탈중앙화된 금융에서 거래의 유효성은 사용자가 '인간과 같은' 사람인지 아닌지에 따라 달라집니다. 따라서 온체인 환경에서 프록시는 웹 2.0 환경에서 흔히 사용되는 보안 문자, 사기 탐지 점수, 디바이스 지문 검사를 우회할 수 있습니다. 그러나 이러한 브라우저가 아마존과 같은 웹2.0 사이트로 연결되는 경우 관련 방어 메커니즘을 우회하지 못하며 해당 시나리오에서도 일반적인 봇 방지 조치가 여전히 트리거됩니다.
프록시 브라우저의 가치는 마술처럼 모든 웹사이트에 액세스할 수 있다는 것이 아닙니다.
사례: 도넛

도넛은 블록체인 데이터를 일류 시민으로서 운영과 통합합니다. 사용자(또는 프록시)는 마우스를 가져가 토큰의 실시간 위험 지표를 확인하거나 "/스왑 100 USDC를 SOL로"와 같은 자연어 명령을 직접 입력할 수 있습니다. 도넛은 웹2.0의 적대적인 마찰 지점을 건너뛰어 에이전트가 디파이에서 최고 속도로 실행하여 유동성, 차익거래 및 시장 효율성을 개선할 수 있도록 지원합니다.
검증 가능하고 신뢰할 수 있는 에이전트 실행
에이전트가 민감한 권한에 액세스할 수 있는 위험은 높습니다. 프록시가 민감한 권한을 얻도록 허용하는 것은 위험합니다. 관련 솔루션은 TEE(신뢰할 수 있는 실행 환경)또는ZKP(제로 지식 증명)를 사용합니다. 를 사용하여 실행 전에 에이전트의 의도된 동작을 암호학적으로 확인하여 사용자와 상대방이 개인 키나 자격 증명을 공개하지 않고도 에이전트의 동작을 확인할 수 있도록 합니다.
예시: Phala Network
Phala는 인텔 SGX와 같은 TEE를 사용하여 실행 환경을 격리하고 보호하여 Phala 운영자나 공격자가 에이전트 로직과 데이터를 엿보거나 변조하지 못하도록 합니다. TEE는 하드웨어 지원 '안전실'의 역할을 하며 기밀성(외부에서 볼 수 없음)과 무결성(외부에서 수정할 수 없음)을 보장합니다. .
브라우저 에이전트의 경우 로그인, 세션 토큰 보유, 결제 정보 처리 등을 수행할 수 있으며,이 민감한 데이터가 보안 룸을 벗어나지 않습니다. 사용자의 컴퓨터, 운영 체제 또는 네트워크가 침해되더라도 손상될 수 없습니다. 이는 에이전트 앱을 시작하는 데 있어 가장 큰 장애물 중 하나인 민감한 자격 증명 및 운영에 대한 신뢰 문제를 직접적으로 완화합니다.
분산형 구조화된 데이터 네트워크
최신 봇 탐지 시스템은 "너무 빠른" 또는 "자동화된" 요청을 검사할 뿐만 아니라 IP 평판, 브라우저 핑거프린팅도 통합합니다, 자바스크립트 문제 피드백 및 행동 분석(예: 커서 이동, 타이핑 리듬, 세션 기록)을 통합합니다. 데이터 센터 IP 또는 완전히 반복 가능한 브라우징 환경에서 오는 프록시는 쉽게 식별할 수 있습니다.
이 문제를 해결하기 위해 이러한 유형의 네트워크는 인간에게 최적화된 웹 페이지를 크롤링하는 대신 기계가 읽을 수 있는 데이터를 수집하여 제공합니다. 또는 실제 사람의 브라우징 환경을 통해 트래픽을 프록시합니다. 이 접근 방식은 기존 크롤러의 파싱 및 카운터 크롤링의 취약성을 우회하고 프록시에 더 깨끗하고 안정적인 입력을 제공합니다.
이러한 실제 세션으로 트래픽을 프록시함으로써 배포 네트워크는 AI 에이전트가 즉시 차단을 트리거하지 않고도 마치 사람처럼 웹 콘텐츠에 액세스할 수 있도록 합니다.
#
사례로 들어보겠습니다.
그래스: 사용자가 사용하지 않는 주거용 광대역을 공유하여 에이전트 친화적이고 지리적으로 다양한 공공 웹 데이터 수집 및 모델 훈련에 대한 액세스를 제공하는 분산형 데이터/DePIN 네트워크입니다.
WootzApp: 백엔드 에이전트와 암호화폐 결제 지원 및 영지식 신원; 소비자에게 AI/데이터 작업을 '게임화'합니다.
Sixpence: 글로벌 기여자 네트워크에 의해 구동되는 분산형 브라우저 네트워크. 브라우징, 트래픽을 AI 에이전트로 라우팅합니다.
하지만 이것이 완전한 해결책은 아닙니다. 행동 감지(마우스/스크롤 트랙), 계정 수준 제한(KYC, 계정 연령) 및 지문 일관성 확인은 여전히 차단을 트리거할 수 있습니다. 따라서 분산 네트워크는 기본 스텔스 레이어로 보는 것이 가장 좋으며, 인간을 모방하는 실행 전략과 결합해야 가장 효과적입니다.
에이전트 지향 웹 표준(미래지향적)
현재 점점 더 많은 기술 커뮤니티와 조직에서 다음과 같은 문제를 탐구하고 있습니다.웹 사용자의 미래가 사람뿐만 아니라 자동화된 에이전트(에이전트)라면 웹 사이트는 어떻게 이들을 안전하고 규정을 준수하며 처리할 수 있을까요?
이 때문에 웹사이트가 현재처럼 에이전트를 기본적으로 '봇 공격자'로 취급하는 대신 "신뢰할 수 있는 에이전트의 접속을 허용합니다"라고 명시하고 상호 작용을 완료할 안전한 채널을 제공할 수 있는 새로운 표준 및 메커니즘에 대한 논의가 활발해졌습니다. 프록시는 현재와 마찬가지로 기본적으로 "봇 공격"으로 차단됩니다.
"에이전트 허용됨 " 태그: 검색 엔진이 준수하는 robots.txt와 마찬가지로 향후 웹 페이지에는 브라우저 에이전트에게 "여기를 방문해도 안전합니다"라는 태그를 코드에 포함시킬 수 있습니다. 예를 들어, 프록시를 사용하여 항공편을 예약하는 경우, 사이트에서는 수많은 보안 문자 대신 인증된 인터페이스만 제공하게 됩니다.
인증된 프록시를 위한 앱 게이트웨이: 사이트에서 인증된 프록시를 위한 전용 포털을 열 수 있습니다. "패스트 트랙". 에이전트는 사람의 클릭과 입력을 에뮬레이션하는 대신 보다 안정적인 API 경로를 통해 주문, 결제 또는 데이터 쿼리를 완료합니다.
W3C 논의:W3C(월드와이드웹 컨소시엄)는 이미 새로운 API를 만드는 방법을 모색하고 있습니다. 표준화된 채널을 개발하기 위한 "관리 자동화". 즉, 향후에는 보안과 책임을 유지하면서 신뢰할 수 있는 에이전트를 웹사이트가 인정하고 받아들일 수 있도록 하는 전 세계적으로 적용되는 일련의 규칙을 갖게 될 것입니다.
이러한 탐색은 아직 초기 단계이지만, 일단 시작되면 인간↔프록시↔웹사이트 간의 관계를 획기적으로 개선할 수 있는 잠재력을 가지고 있습니다. 더 이상 프록시가 필사적으로 사람의 마우스 움직임을 모방하여 바람을 '속이려' 하지 않고, '공식적으로 승인된' 채널을 통해 정직하게 작업을 완료한다고 상상해 보세요.
암호화 네이티브 인프라가 이 길을 가장 먼저 갈 수 있습니다. >. 온체인 애플리케이션은 본질적으로 오픈 API와 스마트 콘트랙트에 의존하기 때문에 자동화에 친화적입니다. 반면, 전통적인 웹2.0 플랫폼, 특히 광고나 사기 방지 시스템에 의존하는 기업들은 계속해서 조심스럽게 방어적인 태도를 보일 것입니다. 하지만 사용자와 기업이 자동화를 통한 효율성 향상을 수용함에 따라 이러한 표준화 시도는 인터넷을 에이전트 우선 아키텍처로 전환하는 데 중요한 촉매제가 될 것입니다.
결론
브라우저 에이전트는 단순한 대화 도구에서 진화하고 있습니다. 단순한 대화형 도구에서 복잡한 온라인 워크플로우를 처리할 수 있는 자율 시스템으로 진화하고 있습니다. 이러한 변화는 사용자가 인터넷과 상호 작용하는 데 사용하는 핵심 인터페이스에 자동화를 직접 내장하는 광범위한 트렌드를 반영합니다. 생산성 향상의 잠재력은 엄청나지만, 고착화된 봇 방지 메커니즘을 뚫는 방법과 보안, 신뢰, 책임감 있는 사용을 보장하는 방법 등 당면한 과제 역시 만만치 않습니다.
단기적으로는 에이전트의 추론 능력 향상, 빠른 속도, 기존 서비스와의 긴밀한 통합, 분산 네트워크의 발전으로 신뢰성이 점진적으로 개선될 수 있습니다. 장기적으로는 자동화가 서비스 제공자와 사용자 모두에게 유익한 시나리오에서 '상담원 친화적인' 표준이 점진적으로 채택될 수 있습니다. 그러나 이러한 변화는 일률적이지는 않을 것이며, DeFi와 같이 자동화에 친화적인 환경에서는 채택이 더 빨라지고 사용자 상호작용 제어에 크게 의존하는 웹2.0 플랫폼에서는 더 느려질 것입니다.
향후 기술 기업 간의 경쟁은 상담원이 실제 제약 조건을 얼마나 잘 헤쳐나가고, 중요한 워크플로에 안전하게 통합하며, 다양한 온라인 환경에서 일관되게 결과를 제공할 수 있는지에 점점 더 초점이 맞춰질 것입니다. . 이 모든 것이 궁극적으로 '브라우저 전쟁'을 재편할지 여부는 기술력만이 아니라 신뢰를 구축하고 인센티브를 조정하며 일상적인 사용에서 실질적인 가치를 입증할 수 있는 능력에 달려 있습니다.