Browser Use
Deja que un agente de IA maneje un navegador real: abrir páginas, hacer clic, escribir, rellenar formularios
Browser Use es una librería de Python y una CLI de código abierto que permiten a un LLM manejar un navegador real —abrir páginas, hacer clic, escribir y rellenar formularios—, de modo que un agente pueda hacer el trabajo web que no tiene ninguna API detrás. La librería usa licencia MIT y funciona en tu propia máquina con el modelo que le indiques; el mismo equipo vende una nube alojada, y su propio README te manda allí para los CAPTCHA y para producción. Esa división resume con honestidad toda la categoría: manejar el navegador es la parte resuelta, y no acabar bloqueado por los sitios que quieres automatizar es la parte que decide si algo de esto funciona.
Qué es Browser Use
Browser Use (github.com/browser-use/browser-use) nació a finales de 2024 y hoy es uno de los proyectos de agentes con más estrellas de GitHub. Es Python, con licencia MIT, y se instala en una línea sobre Python 3.11 o posterior. Le das a un agente una tarea en lenguaje natural y un modelo —los modelos propios del equipo, afinados para navegar, u OpenAI, Anthropic y Google a través de una sola clave, o algo local con Ollama— y trabaja la página como lo haría una persona: lee lo que hay en pantalla, hace clic, escribe y extrae lo que le pediste.
Hay dos formas de entrar, y elegir la equivocada es el error más común al principio. La librería de Python es para la automatización que estás construyendo dentro de tu propio código: muchas ejecuciones programadas o en paralelo, herramientas propias, salida estructurada. La CLI es para un agente que ya usas: instalar su skill deja que un asistente de programación tome el navegador para un encargo puntual. Vale la pena adoptar su propia regla: tareas puntuales a través de un agente, automatización repetible en código. El proyecto también publica como repositorio abierto su banco de pruebas de un centenar de tareas reales de navegación, más rendición de cuentas de la que ofrecen la mayoría de proyectos de agentes, y reclama el primer puesto en una clasificación pública de tareas web de largo recorrido: su medición, no la nuestra.
Dónde encaja en el stack de crecimiento de un fundador
En lo que esto es realmente bueno es en el trabajo web que no tiene API y nunca la tendrá: sitios de los que necesitas sacar algo, o meter algo, y que solo se construyeron para personas. Para un equipo pequeño, el orden sensato en el que intentarlo es el orden de lo que te cuesta una ejecución equivocada.
- Investigación de solo lectura Páginas de precios de la competencia, changelogs, fichas de marketplaces, páginas de reseñas: la materia prima detrás del análisis de competencia. Una ejecución equivocada aquí te cuesta repetirla, que es la forma más barata de equivocarse.
- El mismo formulario por cuadragésima vez Las altas en directorios y marketplaces son el caso más claro: el trabajo es idéntico cada vez y el retorno es real, que es justo por lo que aparecer en los directorios de herramientas de IA resulta tan pesado a mano.
- Tu propio embudo, desde un navegador limpio Registrarte como un desconocido cada mañana detecta el paso roto que tu sesión ya iniciada nunca ve. Está más cerca del QA que del crecimiento, y es el punto aburrido de más valor de esta lista: mira por qué nadie se registra para saber qué suele estar fallando.
- Cualquier cosa que publique o gaste Publicar, escribir a desconocidos, pujar. Aquí es donde la automatización debe parar y una persona debe mirar. Una puerta de aprobación existe exactamente para esta clase de acciones, y un agente de navegador capaz no es motivo para quitarla.
El muro con el que chocas de verdad
Todo relato honesto sobre agentes de navegador llega al mismo sitio, y el propio FAQ del proyecto llega en dos respuestas: para los CAPTCHA te dice que uses su nube, por la huella digital y los proxies, y para producción avisa de que Chrome se come la memoria y las ejecuciones en paralelo son incómodas de gestionar. Ninguna de las dos cosas es un reproche a la librería. Son la factura real, y conviene leerla antes de planificar un flujo de crecimiento sobre ejecuciones locales gratuitas.
| Lo que esperas que sea difícil | Lo que decide de verdad la ejecución |
|---|---|
| Enseñar al agente a hacer clic en lo correcto | Si el sitio llega siquiera a servirte una página |
| El coste de modelo por tarea | Proxies, huella digital e infraestructura de navegadores |
| Que la ejecución falle | Que la ejecución funcione sobre una página que nunca fue el contenido real |
Esa última fila es nuestra, y es lo más caro que hemos aprendido sobre automatización web. AgentCeres —el AI Growth Officer de agentceres.com— usa navegadores automatizados para investigar, y contra sitios con una capa antibots seria sencillamente nunca pasamos: el rechazo llega en el primer byte, antes de que se renderice página alguna, así que nada relativo a lo humano que parezca el clic cambia el resultado, y un plugin de sigilo que dábamos por útil resultó no haberse probado nunca contra esa capa. El fallo silencioso fue el peor. Nuestra propia comprobación de si acabábamos de chocar con un muro antibots solo reconocía páginas de desafío en inglés, así que un desafío servido en otro idioma puntuaba como contenido normal y se resumía como si fuera el sitio. Una ejecución bloqueada es evidente; una que devuelve con aplomo la página equivocada, no.
Así que: apúntalo al trabajo web repetitivo y de bajo riesgo, presupuesta infraestructura de navegadores en vez de dar por hecho que es gratis, y pon una segunda señal sobre cualquier cosa de la que dependa una decisión —una comprobación de que el contenido es el que crees, no solo de que volvió una página—. Deja a una persona en todo lo que salga hacia fuera. Esa última parte es la forma en la que trabaja AgentCeres: un equipo de especialistas redacta el contenido y la prospección, y cada acción hacia fuera espera tu aprobación antes de salir.
FAQ
- ¿Browser Use es gratis?
- La librería sí, con licencia MIT: la ejecutas en tu propia máquina y el código es tuyo para modificarlo. Lo que no es gratis es el modelo: cada paso que da el agente es una llamada al LLM, así que el coste escala con cuántas páginas tiene que atravesar, no con cuántas tareas lanzas. La nube alojada, con sus navegadores sigilosos, rotación de proxies e integraciones, es un producto de pago aparte del mismo equipo.
- ¿Hace falta programar para usarlo?
- Para encargos puntuales, no. Instalar su skill de CLI deja que un asistente de programación que ya usas maneje el navegador a partir de una instrucción en lenguaje natural. La librería de Python es la opción correcta cuando la misma tarea se repite, corre en paralelo o vive dentro de tu propio producto: la regla del propio proyecto es puntual con un agente, repetible en código.
- ¿Superará la detección de bots y los CAPTCHA?
- No de forma fiable en tu propia máquina, y el proyecto lo dice: su FAQ responde tanto a los CAPTCHA como a producción señalando su nube, que aporta proxies y huella digital de navegador. Presupuesta ese coste. Un sitio con una capa antibots seria rechaza la conexión antes de que tu automatización tenga ocasión de ser lista, y ninguna cantidad de clics realistas lo cambia.
- ¿Qué no debería automatizar con un agente de navegador?
- Cualquier cosa que publique, escriba a un desconocido o gaste dinero sin que una persona lo vea antes, y cualquier cosa cuyos términos de servicio prohíban el acceso automatizado, como hacen muchas plataformas. La prueba útil es cuánto cuesta una ejecución equivocada: un scraping malo cuesta repetirlo, una publicación mala cuesta tu reputación, y solo una de las dos se arregla en una tarde.
You built it. Now grow it.
AgentCeres is a managed AI marketing team — specialists draft the SEO, social, and outreach that fill your links, you approve what ships. 14-day free trial, from $39/month.