The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

7 stars 2 forks 7 watchers TypeScript MIT License
agent-evaluation ai-agent claude eval evaluation llm mcp mcp-server model-context-protocol observability security tracing
8 Open Issues Need Help Last updated: Aug 12, 2026

Open Issues Need Help

View All on GitHub
enhancement good first issue effort: large dashboard

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: large

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: medium

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: medium dashboard

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: large

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: small

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: small

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing
enhancement good first issue effort: small

The agent eval standard for MCP — score output quality, catch safety failures, enforce cost budgets

TypeScript
#agent-evaluation#ai-agent#claude#eval#evaluation#llm#mcp#mcp-server#model-context-protocol#observability#security#tracing