Pre-registered A/B/C benchmark: Superpowers vs OpenSpec vs baseline, on real brownfield ops code. Methodology frozen before runs; results published either way.

agent-skills ai-agents benchmark claude-code claude-skills llm-evaluation
1 Open Issue Need Help Last updated: Sep 22, 2026

Open Issues Need Help

View All on GitHub

Pre-registered A/B/C benchmark: Superpowers vs OpenSpec vs baseline, on real brownfield ops code. Methodology frozen before runs; results published either way.

#agent-skills#ai-agents#benchmark#claude-code#claude-skills#llm-evaluation