One persona, one frozen memory, N models: how much of an agent's character survives a model swap? Harness + blind multi-lens judge panel + cross-vendor rank control + contamination probe. Results included: 7 models, spread 4.80 -> 2.20.

agent-evaluation agent-skills ai-agents benchmark claude-code claude-skills context-engineering eval-harness llm llm-as-a-judge llm-evaluation model-comparison persona prompt-engineering
2 Open Issues Need Help Last updated: Sep 20, 2026

Open Issues Need Help

View All on GitHub
help wanted accepted

One persona, one frozen memory, N models: how much of an agent's character survives a model swap? Harness + blind multi-lens judge panel + cross-vendor rank control + contamination probe. Results included: 7 models, spread 4.80 -> 2.20.

Python
#agent-evaluation#agent-skills#ai-agents#benchmark#claude-code#claude-skills#context-engineering#eval-harness#llm#llm-as-a-judge#llm-evaluation#model-comparison#persona#prompt-engineering

One persona, one frozen memory, N models: how much of an agent's character survives a model swap? Harness + blind multi-lens judge panel + cross-vendor rank control + contamination probe. Results included: 7 models, spread 4.80 -> 2.20.

Python
#agent-evaluation#agent-skills#ai-agents#benchmark#claude-code#claude-skills#context-engineering#eval-harness#llm#llm-as-a-judge#llm-evaluation#model-comparison#persona#prompt-engineering