HealthBench Hard

Models

16 models evaluated · updated September 8, 2026

The whole board in one table, together with the API facts that determine whether a score matters in practice: context window, list price per token, license. Every model links through to a page with its full result and head-to-head comparisons.

Ranking

#modelscoresizecontextcost in / out per 1Mlicense
1Meta logoMuse Spark Meta0.428—1.0M$1.25 / $4.25proprietary
2OpenAI logoGPT-6 Astra OpenAI0.363—1.05M$10.00 / $50.00proprietary
3OpenAI logoGPT-5 OpenAI0.347—400K$1.25 / $10.00proprietary
4OpenAI logoGPT-5.2 OpenAI0.343—400K$1.75 / $14.00proprietary
5OpenAI logoGPT-5.6 Sol OpenAI0.331—1.1M$5.00 / $30.00proprietary
6OpenAI logoGPT-5.6 Terra OpenAI0.327—1.1M$2.00 / $12.00proprietary
7OpenAI logoGPT-5.6 Luna OpenAI0.320—1.1M$0.20 / $1.20proprietary
8OpenAI logoGPT-5.5 OpenAI0.315—1.05M$5.00 / $30.00proprietary
9OpenAI logoGPT-5.6 Sol (August) OpenAI0.314—1.1M$5.00 / $30.00proprietary
10OpenAI logoGPT OSS 120B OpenAI0.300117B131K—open
11OpenAI logoGPT-5.4 OpenAI0.291—1.05M$2.50 / $15.00proprietary
12OpenAI logoGPT-5.6 Luna (August) OpenAI0.287—1.1M$0.20 / $1.20proprietary
13OpenAI logoGPT-5.3 Chat OpenAI0.259—128K$1.75 / $14.00proprietary
14OpenAI logoGPT-5.1 OpenAI0.254—400K$1.25 / $10.00proprietary
15OpenAI logoGPT-5.5 Instant OpenAI0.229—400K$5.00 / $30.00proprietary
16OpenAI logoGPT OSS 20B OpenAI0.10821B131K—open

Model pages