A/B test agent skills with blind grading + bootstrap CIs - does your SKILL.md actually improve task performance?

ab-testing agent-skill ai-agents benchmark claude-code claude-skill cli codex-skills developer-tools evals llm llm-eval nodejs prompt-engineering testing typescript
2 Open Issues Need Help Last updated: Sep 11, 2026

Open Issues Need Help

View All on GitHub

A/B test agent skills with blind grading + bootstrap CIs - does your SKILL.md actually improve task performance?

TypeScript
#ab-testing#agent-skill#ai-agents#benchmark#claude-code#claude-skill#cli#codex-skills#developer-tools#evals#llm#llm-eval#nodejs#prompt-engineering#testing#typescript

A/B test agent skills with blind grading + bootstrap CIs - does your SKILL.md actually improve task performance?

TypeScript
#ab-testing#agent-skill#ai-agents#benchmark#claude-code#claude-skill#cli#codex-skills#developer-tools#evals#llm#llm-eval#nodejs#prompt-engineering#testing#typescript