Open-source benchmark for browser AI agents on daily tasks.

705 stars 51 forks 705 watchers Python Apache License 2.0
agent-evaluation agentic-ai ai-agent-benchmark ai-agents benchmark browser-agent browser-automation browser-use chrome-agent chrome-extension computer-use dataset evaluation everyday-tasks llm llm-evaluation online-tasks real-world-benchmark web-agent web-agents
4 Open Issues Need Help Last updated: Sep 10, 2026

Open Issues Need Help

View All on GitHub

Open-source benchmark for browser AI agents on daily tasks.

Python
#agent-evaluation#agentic-ai#ai-agent-benchmark#ai-agents#benchmark#browser-agent#browser-automation#browser-use#chrome-agent#chrome-extension#computer-use#dataset#evaluation#everyday-tasks#llm#llm-evaluation#online-tasks#real-world-benchmark#web-agent#web-agents

Open-source benchmark for browser AI agents on daily tasks.

Python
#agent-evaluation#agentic-ai#ai-agent-benchmark#ai-agents#benchmark#browser-agent#browser-automation#browser-use#chrome-agent#chrome-extension#computer-use#dataset#evaluation#everyday-tasks#llm#llm-evaluation#online-tasks#real-world-benchmark#web-agent#web-agents

Open-source benchmark for browser AI agents on daily tasks.

Python
#agent-evaluation#agentic-ai#ai-agent-benchmark#ai-agents#benchmark#browser-agent#browser-automation#browser-use#chrome-agent#chrome-extension#computer-use#dataset#evaluation#everyday-tasks#llm#llm-evaluation#online-tasks#real-world-benchmark#web-agent#web-agents

Open-source benchmark for browser AI agents on daily tasks.

Python
#agent-evaluation#agentic-ai#ai-agent-benchmark#ai-agents#benchmark#browser-agent#browser-automation#browser-use#chrome-agent#chrome-extension#computer-use#dataset#evaluation#everyday-tasks#llm#llm-evaluation#online-tasks#real-world-benchmark#web-agent#web-agents