Hur lättlurad är er AI-modell?
Bullshit Benchmark mäter hur väl AI-modeller genomskådar övertygande men felaktiga påståenden – t.ex. påhittade ramverk, falska auktoriteter och skenbart exakta siffror. Ett konkret underlag när ni väljer AI-verktyg och gör riskbedömningar enligt AI Act.
Claude Opus 4.8
Snittpoäng 1.93 av 2
224
AI-modeller & konfigurationer
22
OpenAI, Anthropic, Google m.fl.
2026-09-29
Hämtas automatiskt varje dag
| # | Modell | Poäng | Genomskådat nonsens |
|---|---|---|---|
| 1 | Claude Opus 4.8 | 1.93 | 95% |
| 2 | Claude Opus 4.8 | 1.92 | 94% |
| 3 | Qwen3.8 Max | 1.92 | 95% |
| 4 | Claude Sonnet 4.6 | 1.87 | 91% |
| 5 | Claude Sonnet 4.6 | 1.86 | 89% |
| 6 | Claude Opus 4.5 | 1.84 | 90% |
| 7 | Claude Opus 4.6 | 1.84 | 87% |
| 8 | Claude Fable 5.1 | 1.82 | 77% |
| 9 | Claude Opus 4.6 | 1.79 | 83% |
| 10 | Claude Opus 4.7 | 1.78 | 83% |
| 11 | Claude Fable 5 | 1.76 | 56% |
| 12 | Claude Opus 5 | 1.72 | 70% |
| 13 | Claude Sonnet 5 | 1.72 | 80% |
| 14 | Claude Sonnet 5 | 1.72 | 78% |
| 15 | Claude Opus 5 | 1.71 | 73% |
| 16 | Qwen3.5 397b A17b | 1.70 | 78% |
| 17 | Claude Sonnet 4.5 | 1.68 | 79% |
| 18 | Claude Opus 4.5 | 1.67 | 79% |
| 19 | Kimi K3 | 1.67 | 74% |
| 20 | Claude Fable 5.1 | 1.66 | 64% |
| 21 | Kimi K3 | 1.64 | 72% |
| 22 | Claude Fable 5 | 1.64 | 45% |
| 23 | Claude Haiku 4.5 | 1.64 | 77% |
| 24 | Claude Opus 5.5 | 1.64 | 63% |
| 25 | Qwen3.8 27b | 1.63 | 79% |
| 26 | Claude Opus 5.5 | 1.63 | 62% |
| 27 | Claude Haiku 4.5 | 1.63 | 71% |
| 28 | Claude Opus 4.7 | 1.62 | 74% |
| 29 | Glm 5.3 | 1.61 | 72% |
| 30 | Gpt 6 Astra | 1.61 | 69% |
| 31 | Claude Sonnet 4.5 | 1.59 | 74% |
| 32 | Qwen3.7 Max | 1.57 | 72% |
| 33 | Qwen3.6 Plus | 1.56 | 72% |
| 34 | Glm 5.3 | 1.54 | 66% |
| 35 | Gpt 6 Astra | 1.54 | 64% |
| 36 | Qwen3.5 397b A17b | 1.53 | 69% |
| 37 | Gemini 3.5 Flash Lite | 1.52 | 66% |
| 38 | Qwen3 Max Thinking | 1.50 | 63% |
| 39 | Kimi K2.6 | 1.49 | 65% |
| 40 | Minimax M3 | 1.48 | 64% |
| 41 | Grok 4.6 | 1.48 | 66% |
| 42 | Ox Alpha | 1.47 | 65% |
| 43 | Gpt 6 Luna Pro | 1.46 | 59% |
| 44 | Gpt 6 Sol | 1.46 | 54% |
| 45 | Minimax M3 | 1.44 | 63% |
| 46 | Gpt 6 Sol Pro | 1.44 | 57% |
| 47 | Grok 4.20 Multi Agent Beta | 1.43 | 64% |
| 48 | Gpt 6 Luna | 1.43 | 58% |
| 49 | Grok 4.20 Multi Agent Beta | 1.43 | 67% |
| 50 | Mimo V2.5 Pro | 1.42 | 62% |
| 51 | Ox Alpha | 1.42 | 54% |
| 52 | Qwen3.6 Plus | 1.42 | 59% |
| 53 | Deepseek V4.1 Flash | 1.42 | 57% |
| 54 | Gemini 3.5 Flash Lite | 1.41 | 60% |
| 55 | Gpt 6 Sol | 1.41 | 59% |
| 56 | Deepseek V4.1 Flash | 1.41 | 57% |
| 57 | Gpt 6 Sol Pro | 1.38 | 55% |
| 58 | Gpt 5.6 Terra | 1.38 | 54% |
| 59 | Gpt 6 Luna | 1.37 | 59% |
| 60 | Gpt 6 Luna Pro | 1.37 | 57% |
| 61 | Grok 4.6 | 1.35 | 56% |
| 62 | Qwen3.7 Max | 1.34 | 57% |
| 63 | Grok 4.5 | 1.32 | 54% |
| 64 | Grok 4.5 | 1.30 | 55% |
| 65 | Grok 4.3 | 1.30 | 50% |
| 66 | Gpt 5.6 Sol | 1.30 | 48% |
| 67 | Gpt 5.6 Sol | 1.29 | 47% |
| 68 | Grok 4.20 Beta | 1.27 | 54% |
| 69 | Kimi K2.6 | 1.27 | 50% |
| 70 | Gpt 5.5 | 1.27 | 47% |
| 71 | Grok 4.20 Beta | 1.26 | 56% |
| 72 | Gpt 5.4 | 1.25 | 48% |
| 73 | Nemotron 3 Super 120b A12b:Free | 1.23 | 54% |
| 74 | Kimi K2.5 | 1.23 | 52% |
| 75 | Gpt 5.5 | 1.22 | 45% |
| 76 | Muse Spark 1.2 | 1.21 | 50% |
| 77 | Gpt 5.6 Terra | 1.20 | 47% |
| 78 | Gpt 5.5 | 1.20 | 45% |
| 79 | Gpt 5.6 Luna | 1.20 | 41% |
| 80 | Gpt 5.4 | 1.17 | 42% |
| 81 | Muse Spark 1.2 | 1.15 | 49% |
| 82 | Claude 3.7 Sonnet:Thinking | 1.14 | 49% |
| 83 | Qwen3 Max Thinking | 1.14 | 46% |
| 84 | Gpt 5.2 Codex | 1.14 | 45% |
| 85 | Gemini 3 Pro Preview | 1.13 | 48% |
| 86 | Claude Opus 4.1 | 1.12 | 43% |
| 87 | Nemotron 3 Super 120b A12b | 1.12 | 47% |
| 88 | Grok 4.3 | 1.12 | 46% |
| 89 | Claude Opus 4.1 | 1.12 | 42% |
| 90 | Claude 3.5 Haiku | 1.11 | 50% |
| 91 | Gpt 5.2 | 1.10 | 38% |
| 92 | Gpt 5.5 Pro | 1.09 | 34% |
| 93 | Deepseek V4 Flash 0731 | 1.08 | 39% |
| 94 | Nemotron 3 Ultra 550b A55b | 1.07 | 49% |
| 95 | Claude 3.5 Sonnet | 1.07 | 46% |
| 96 | Gpt 5.5 Pro | 1.07 | 36% |
| 97 | Gpt 5.6 Luna | 1.06 | 37% |
| 98 | Gpt 5.3 Chat | 1.06 | 40% |
| 99 | Gpt 5.1 Chat | 1.05 | 45% |
| 100 | Gemini 3.1 Pro Preview | 1.05 | 37% |
| 101 | Gpt 5.4 Mini | 1.05 | 31% |
| 102 | Claude 3.7 Sonnet | 1.03 | 44% |
| 103 | Nemotron 3 Super 120b A12b:Free | 1.02 | 43% |
| 104 | Hunter Alpha | 1.02 | 43% |
| 105 | Gpt 5.2 | 1.02 | 28% |
| 106 | Gpt 5.5 Chat | 1.01 | 34% |
| 107 | Gpt 5 Codex | 1.01 | 39% |
| 108 | Gpt 5.2 Codex | 1.01 | 39% |
| 109 | Claude Opus 4 | 0.99 | 34% |
| 110 | Deepseek V4 Pro 0813 | 0.98 | 35% |
| 111 | Gpt 5.4 Mini | 0.98 | 32% |
| 112 | Gpt 5.2 Codex | 0.97 | 37% |
| 113 | Kimi K2.5 | 0.95 | 31% |
| 114 | Qwen3.8 Max | 0.95 | 27% |
| 115 | Gemini 3 Pro Preview | 0.94 | 36% |
| 116 | Gpt 5.4 Mini | 0.94 | 32% |
| 117 | Nemotron 3 Ultra 550b A55b | 0.94 | 40% |
| 118 | Mimo V2.5 Pro | 0.94 | 38% |
| 119 | Qwen3.8 27b | 0.94 | 29% |
| 120 | Gemini 3.7 Flash | 0.93 | 35% |
| 121 | Deepseek V4 Pro 0813 | 0.92 | 32% |
| 122 | Gemini 3.6 Flash | 0.92 | 39% |
| 123 | Healer Alpha | 0.92 | 37% |
| 124 | Gpt 5.1 | 0.88 | 25% |
| 125 | Claude Sonnet 4 | 0.87 | 29% |
| 126 | Mimo V2.5 | 0.87 | 35% |
| 127 | Gemini 3.1 Pro Preview | 0.87 | 31% |
| 128 | Hunter Alpha | 0.86 | 35% |
| 129 | Claude Sonnet 4 | 0.85 | 30% |
| 130 | Gpt 5.1 Codex | 0.84 | 32% |
| 131 | Llama 4 Maverick | 0.84 | 29% |
| 132 | Gpt 5.2 Chat | 0.83 | 27% |
| 133 | Gpt 5.3 Codex | 0.83 | 24% |
| 134 | Gemini 3.7 Flash | 0.82 | 31% |
| 135 | Gpt 5 | 0.82 | 21% |
| 136 | Gemini 3.6 Flash | 0.78 | 28% |
| 137 | Glm 5 Turbo | 0.78 | 31% |
| 138 | Nemotron 3 Super 120b A12b | 0.77 | 31% |
| 139 | Glm 5.2 | 0.75 | 31% |
| 140 | Gemma 4.31b It | 0.74 | 25% |
| 141 | Glm 5 | 0.73 | 28% |
| 142 | Nemotron 3 Nano 30b A3b:Free | 0.70 | 28% |
| 143 | Gpt 5.3 Codex | 0.69 | 20% |
| 144 | Gpt 5.3 Codex | 0.68 | 19% |
| 145 | O3 | 0.67 | 26% |
| 146 | Healer Alpha | 0.66 | 26% |
| 147 | Deepseek V4 Flash 0731 | 0.66 | 20% |
| 148 | Gemma 4.26b A4b It | 0.65 | 21% |
| 149 | Gpt 5 Chat | 0.64 | 18% |
| 150 | Mimo V2.5 | 0.63 | 24% |
| 151 | Qwen3 Coder | 0.63 | 20% |
| 152 | Glm 5 Turbo | 0.62 | 23% |
| 153 | Glm 5.1 | 0.61 | 22% |
| 154 | Step 3.5 Flash | 0.60 | 22% |
| 155 | Laguna S 2.1 | 0.60 | 21% |
| 156 | Gemini 2.5 Pro | 0.60 | 20% |
| 157 | Glm 5 | 0.59 | 20% |
| 158 | Deepseek V4 Flash | 0.58 | 18% |
| 159 | Grok 4.1 Fast | 0.58 | 19% |
| 160 | Deepseek V4 Pro | 0.57 | 14% |
| 161 | Llama 4 Scout | 0.57 | 20% |
| 162 | Llama 3.1 8b Instruct | 0.57 | 14% |
| 163 | Glm 5.2 | 0.56 | 17% |
| 164 | Gemma 4.31b It | 0.56 | 20% |
| 165 | Gemini 3.5 Flash | 0.56 | 20% |
| 166 | Mimo V2 Flash | 0.55 | 16% |
| 167 | Hy3 Preview:Free | 0.55 | 16% |
| 168 | Gemini 2.5 Flash | 0.54 | 19% |
| 169 | Laguna S 2.1 | 0.53 | 22% |
| 170 | Gpt 5.4 Nano | 0.52 | 14% |
| 171 | Trinity Large Thinking | 0.51 | 17% |
| 172 | Glm 5.1 | 0.50 | 18% |
| 173 | Gpt 5.4 Nano | 0.50 | 14% |
| 174 | Gpt 4o 2024.08.06 | 0.49 | 12% |
| 175 | Gemini 3.5 Flash | 0.49 | 19% |
| 176 | Deepseek V4 Pro | 0.49 | 14% |
| 177 | Gemini 2.0 Flash 001 | 0.48 | 15% |
| 178 | Deepseek V3.2 | 0.46 | 13% |
| 179 | Hy3 Preview:Free | 0.46 | 8% |
| 180 | Minimax M2.5 | 0.44 | 9% |
| 181 | Gpt 4.1 | 0.43 | 14% |
| 182 | Step 3.5 Flash | 0.43 | 13% |
| 183 | Trinity Large Thinking | 0.42 | 13% |
| 184 | Gpt 5.4 Nano | 0.42 | 10% |
| 185 | Gemma 4.26b A4b It | 0.41 | 11% |
| 186 | Gemini 3 Flash Preview | 0.41 | 10% |
| 187 | Seed 1.6 | 0.41 | 7% |
| 188 | Gemini 3.1 Flash Lite Preview | 0.40 | 11% |
| 189 | Gpt Oss 120b | 0.40 | 12% |
| 190 | Deepseek V4 Flash | 0.40 | 14% |
| 191 | Mimo V2 Flash | 0.40 | 13% |
| 192 | Seed 1.6 | 0.40 | 11% |
| 193 | Deepseek V3.2 | 0.40 | 10% |
| 194 | Minimax M2.7 | 0.40 | 7% |
| 195 | Minimax M2.5 | 0.39 | 8% |
| 196 | Ernie 4.5 Vl 424b A47b | 0.36 | 11% |
| 197 | Claude 3 Haiku | 0.34 | 10% |
| 198 | Deepseek R1 | 0.34 | 7% |
| 199 | Gemini 3 Flash Preview | 0.34 | 10% |
| 200 | Glm 4.5 | 0.34 | 8% |
| 201 | Nemotron 3 Nano 30b A3b:Free | 0.33 | 10% |
| 202 | Kimi K2 | 0.33 | 10% |
| 203 | Minimax M2.7 | 0.33 | 8% |
| 204 | Mistral Small 2603 | 0.33 | 6% |
| 205 | Deepseek R1 | 0.31 | 8% |
| 206 | Qwen3.235b A22b | 0.31 | 6% |
| 207 | Grok 4.1 Fast | 0.30 | 10% |
| 208 | Glm 4.5 | 0.30 | 6% |
| 209 | Gpt Oss 120b | 0.30 | 5% |
| 210 | O4 Mini | 0.29 | 4% |
| 211 | Ernie 4.5 Vl 424b A47b | 0.29 | 3% |
| 212 | O4 Mini | 0.28 | 8% |
| 213 | Qwen3.235b A22b | 0.27 | 3% |
| 214 | Ernie 4.5 300b A47b | 0.27 | 4% |
| 215 | Nemotron Nano 9b V2:Free | 0.26 | 5% |
| 216 | Nemotron Nano 9b V2:Free | 0.24 | 3% |
| 217 | Intellect 3 | 0.23 | 7% |
| 218 | Deepseek Chat | 0.22 | 4% |
| 219 | Intellect 3 | 0.19 | 5% |
| 220 | Jamba Large 1.7 | 0.19 | 5% |
| 221 | Mistral Large 2512 | 0.17 | 2% |
| 222 | Mistral Small 2603 | 0.16 | 4% |
| 223 | Gpt 4o Mini 2024.07.18 | 0.16 | 2% |
| 224 | Gemma 3.27b It | 0.15 | 3% |
Så läser du tabellen
Poäng (0–2): snittbetyg från en panel av AI-domare. 2 = modellen genomskådade nonsenset helt, 0 = modellen gick på det. Genomskådat nonsens visar andelen frågor där modellen fick full poäng.
Datan hämtas automatiskt varje dag från det öppna projektet Bullshit Benchmark av Peter Gostev. All ära för metodik och testdata tillhör originalprojektet.
Behöver ni hjälp med AI Act och riskbedömning av AI-verktyg?
Vi hjälper er att klassificera AI-system, upprätta styrdokument och välja rätt verktyg för verksamheten.
Boka säkerhetsanalys