Open Issues Need Help
View All on GitHub help wanted accepted
One persona, one frozen memory, N models: how much of an agent's character survives a model swap? Harness + blind multi-lens judge panel + cross-vendor rank control + contamination probe. Results included: 7 models, spread 4.80 -> 2.20.
Python
#agent-evaluation#agent-skills#ai-agents#benchmark#claude-code#claude-skills#context-engineering#eval-harness#llm#llm-as-a-judge#llm-evaluation#model-comparison#persona#prompt-engineering
help wanted accepted
One persona, one frozen memory, N models: how much of an agent's character survives a model swap? Harness + blind multi-lens judge panel + cross-vendor rank control + contamination probe. Results included: 7 models, spread 4.80 -> 2.20.
Python
#agent-evaluation#agent-skills#ai-agents#benchmark#claude-code#claude-skills#context-engineering#eval-harness#llm#llm-as-a-judge#llm-evaluation#model-comparison#persona#prompt-engineering