Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

agent-evaluation ai-agents enterprise-ai llm-evaluation python responsible-ai
6 Open Issues Need Help Last updated: Sep 23, 2026

Open Issues Need Help

View All on GitHub
help wanted good first issue

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai
help wanted good first issue

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai
help wanted

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai
help wanted

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai
help wanted good first issue

Vendor-neutral evaluation harness for measuring enterprise AI agents across task success, grounding, tool use, safety, escalation, latency and cost

Python
#agent-evaluation#ai-agents#enterprise-ai#llm-evaluation#python#responsible-ai