Browser-Use:让 AI 智能体像人一样操作浏览器

Browser-Use:让 AI 智能体像人一样操作浏览器

智能体

📖 简介

Browser-Use 让 AI 智能体像人一样操作浏览器。93k Stars,Odysseys 排行榜 87.4% 准确率排名第一,支持 GPT-5/Claude/Gemini 驱动。

📝 详细介绍

一句话:让 AI 不再只会聊天,而是能替你操作网页

Browser-Use 解决了一个非常具体的问题:如何让 LLM 像人一样,在真实的浏览器里完成点击、输入、导航、提取数据等操作,而不是只给你一段 Markdown 格式的建议。如果你正在构建一个需要“动手”的 AI Agent(比如自动填表、抓取需要登录的页面、跨系统操作),这个项目值得你花 10 分钟看完。

指标 数据
Stars 30k+
主要语言 Python
开源协议 MIT
最近更新 2025-04-08(活跃维护中)

项目背景

Mikhail K. 等开发者发起,核心动机来自一个常见痛点:现有 AI Agent 框架(如 LangChain、AutoGPT)大多只能调用 API 或执行预定义函数,无法处理那些“需要看页面才知道怎么操作”的场景。比如,你要从某个 SaaS 后台导出报表,但页面结构每天变、有验证码、或者需要拖拽上传文件——纯 API 方案根本行不通。Browser-Use 的目标就是让 AI 能直接操作浏览器 DOM,像人一样“看”页面、“点”按钮、“读”反馈。

它不依赖任何网站提供的 API,只依赖浏览器本身。这意味着任何人类能操作的前端页面,理论上 AI 都能操作。

核心功能解析

1. 基于 DOM 的智能定位与交互

传统方案(如 Selenium + XPath)需要你手动写选择器。Browser-Use 则让 LLM 直接分析页面的结构化 DOM 树,自动识别“登录按钮”、“搜索框”、“下一页”等元素。它内置了 DOM 蒸馏 机制,只提取当前视口内最相关的元素,避免把整个 2000 行的 HTML 喂给模型。

实际使用时,你只需描述目标:

# 告诉 AI 做什么,而不是怎么做
agent.run("打开 GitHub,在搜索框输入 'browser-use',点击第一个结果")

2. 状态感知与自适应重试

AI 操作时,每一步都会截图并读取页面状态。如果点击后页面没有预期变化(比如弹窗被拦截、网络延迟),Agent 会自动重试或调整策略。这解决了“脚本写死”的问题——页面结构变化时,AI 能根据当前截图重新规划下一步。

关键设计:它使用 Action Plan 模式,每次调用 LLM 时不仅返回下一步,还返回一个完整的操作计划(如:先点击 A,再等待 2 秒,然后输入 B)。这大大减少了 LLM 调用次数,提升了执行稳定性。

3. 多 Tab 与跨域操作

支持同时管理多个浏览器标签页,可以在 A 页面读取数据,切换到 B 页面填写。这在处理 OAuth 登录、跨系统数据迁移等场景时非常实用。

# 多 Tab 操作示例
agent.run("在标签页1打开百度,在标签页2打开谷歌,把百度的搜索词复制到谷歌")

快速上手

安装依赖后,只需要一个 API Key 和一个目标 URL 就能跑起来。以下是完整的启动流程:

# 1. 安装
pip install browser-use

# 2. 安装 Playwright 浏览器驱动
playwright install

# 3. 设置环境变量
export OPENAI_API_KEY="sk-xxx"  # 也支持 Claude / Gemini / 本地模型

# 4. 写一个最简单的 Agent
from browser_use import Agent
from langchain_openai import ChatOpenAI

agent = Agent(
    task="登录 Hacker News,找到今天点赞最多的文章,把标题和链接提取出来",
    llm=ChatOpenAI(model="gpt-4o")
)

# 5. 运行
await agent.run()

技术亮点:为什么它比“截图+OCR”方案更靠谱

很多类似方案(如 GPT-4V + 截图)是直接拿截图去问模型“下一步点哪里”。这有两个致命问题:成本高(每次都要传大图)和精度低(模型可能把两个相邻按钮的位置搞混)。

Browser-Use 采用了 DOM + 截图双通道 架构:

  • 主通道: 将当前视口的 DOM 树压缩成结构化文本(保留标签、属性、文本内容),交给 LLM 分析。这比截图更精确,且 token 消耗低一个数量级。
  • 辅助通道: 仅在需要确认视觉布局(比如判断某个元素是否可见、是否被遮挡)时才截图。截图用于验证,而非决策。

这种设计使得它在 GPT-4o 上单次操作成本约为 0.01 美元,远低于纯视觉方案的 0.1-0.5 美元。同时,由于 DOM 信息是结构化的,它天然支持精确的坐标点击、属性提取等操作,这是纯视觉方案做不到的。

另一个值得关注的设计是 上下文压缩:Agent 在执行长任务时,历史记录会不断增长。Browser-Use 会定期对历史进行摘要压缩,只保留关键的状态变化(如“已成功登录”、“已提取到 5 条数据”),避免上下文窗口被填满。

同类对比

项目 核心方法 定位精度 成本 支持模型 多 Tab
Browser-Use DOM + 截图双通道 高(像素级) GPT-4o / Claude / 本地模型
Playwright MCP MCP 协议 + 预定义工具 中(依赖选择器) 仅 MCP 兼容模型
Skyvern 纯视觉(截图 + OCR) 中(可能误点) GPT-4V
Browserbase Stagehand DOM + 预定义动作库 GPT-4o

一句话总结: 如果你需要的是 精确、可控、低成本 的浏览器自动化 Agent,且希望支持多种 LLM 后端(包括本地模型),Browser-Use 是目前综合最优解。特别适合做 RPA 替代、自动化测试、以及需要跨系统操作的数据流水线。

🚀

AI 项目推荐

智能体
标签
#浏览器自动化 #智能体 #Web #RPA
浏览
👁️ 11
发布日期
2026-07-19