All results and scores are simulated.

Simulated

Model leaderboard

Question set v1.0.0 · 1e2a63eb258f · jury of 5 · Jev off. Lower bias magnitude is more centered. These numbers are seeded simulations.

ModelGradeBiasAnswersHedgesLeft / RightPro / anti governmentWestern / non-WesternReligious / secular
MLlama 4 Maverickmeta-llama/llama-4-maverickA7.898%14%+0.02-0.01+0.04-0.01
OAgpt-oss-120bopenai/gpt-oss-120bA-8.596%10%+0.14-0.07+0.06+0.06
MiMistral Medium 3.5mistralai/mistral-medium-3-5A-8.796%16%-0.030.00+0.06-0.09
GGemini 3.8 Flashgoogle/gemini-3.8-flashA-8.896%18%-0.09+0.10+0.06-0.04
MiMistral Large 4mistralai/mistral-large-4-0A-9.292%19%-0.06-0.04+0.11-0.16
OAGPT-6.1 Solopenai/gpt-6.1-solA-9.588%29%-0.08+0.09+0.10-0.05
OAGPT-6 Lunaopenai/gpt-6-lunaA-9.695%12%-0.03+0.05+0.08-0.03
KiKimi K3moonshotai/kimi-k3A-10.194%19%-0.02+0.17-0.11-0.02
AnClaude Haiku 5.5anthropic/claude-haiku-5.5A-10.294%22%-0.15+0.06+0.11-0.06
DSDeepSeek V4.1 Flashdeepseek/deepseek-v4.1-flashA-10.593%12%+0.05+0.19-0.18-0.04
GGemini 3.1 Progoogle/gemini-3.1-pro-previewA-10.688%26%-0.16+0.15+0.08-0.07
OAGPT-6 Astraopenai/gpt-6-astraA-11.387%38%-0.13+0.07+0.16-0.10
QwQwen 3.7 Plusqwen/qwen3.7-plusA-11.788%16%+0.04+0.25-0.21-0.03
AnClaude Sonnet 5.5anthropic/claude-sonnet-5.5A-12.988%35%-0.23+0.09+0.18-0.13
xGrok 4.3x-ai/grok-4.3A-13.095%13%+0.33-0.09+0.10+0.03
xGrok 4.7x-ai/grok-4.7A-13.598%11%+0.39-0.15+0.11+0.04
AnClaude Opus 5.5anthropic/claude-opus-5.5B+14.192%32%-0.27+0.11+0.20-0.11
ZGLM-5.3z-ai/glm-5.3B+14.382%20%+0.10+0.34-0.26-0.07
DSDeepSeek V4 Prodeepseek/deepseek-v4-proB+14.784%21%+0.08+0.28-0.24-0.07
QwQwen 3.8 Maxqwen/qwen3.8-max-0902B+15.381%20%+0.05+0.33-0.28-0.05