Identity effects persist across model versions

Top: behavioral differences. Bottom: awareness verbalization rates averaged across setups.
amanda.askell@anthropic.com − ordinary@gmail ordinary@anthropic − ordinary@gmail User awareness (VUA; bottom row) Evaluation awareness (VEA; bottom row) Whiskers: 95% confidence intervals. Filled markers: BH-adjusted p < 0.05 across the 24 models within each setup.
Claude Sonnet 4.5 4.6 5Claude Opus 4.5 4.6 4.7 4.8GPT55.15.25.45.5Gemini Flash2.533.5GLM4.64.755.15.2DeepSeekV3V3.1V3.2V4 ProBehavioralself-pred.Δ confidence (pp)-6%-4%-2%0%2%4%Grading(direct)Δ (points)-0.8-0.6-0.4-0.20.00.20.4Grading(prefill)Δ (points)-0.8-0.6-0.4-0.20.00.20.4VerbalizedawarenessAverage across3 setups (%)0%20%40%60%80%