Hoppa till innehållet
A I Benchmark
AI-riskbedömning

Hur lättlurad är er AI-modell?

Bullshit Benchmark mäter hur väl AI-modeller genomskådar övertygande men felaktiga påståenden – t.ex. påhittade ramverk, falska auktoriteter och skenbart exakta siffror. Ett konkret underlag när ni väljer AI-verktyg och gör riskbedömningar enligt AI Act.

Bäst i test

Claude Opus 4.8

Snittpoäng 1.93 av 2

Testade modeller

224

AI-modeller & konfigurationer

Organisationer

22

OpenAI, Anthropic, Google m.fl.

Senast uppdaterad

2026-09-29

Hämtas automatiskt varje dag

#ModellPoängGenomskådat nonsens
1Claude Opus 4.81.93
95%
2Claude Opus 4.81.92
94%
3Qwen3.8 Max1.92
95%
4Claude Sonnet 4.61.87
91%
5Claude Sonnet 4.61.86
89%
6Claude Opus 4.51.84
90%
7Claude Opus 4.61.84
87%
8Claude Fable 5.11.82
77%
9Claude Opus 4.61.79
83%
10Claude Opus 4.71.78
83%
11Claude Fable 51.76
56%
12Claude Opus 51.72
70%
13Claude Sonnet 51.72
80%
14Claude Sonnet 51.72
78%
15Claude Opus 51.71
73%
16Qwen3.5 397b A17b1.70
78%
17Claude Sonnet 4.51.68
79%
18Claude Opus 4.51.67
79%
19Kimi K31.67
74%
20Claude Fable 5.11.66
64%
21Kimi K31.64
72%
22Claude Fable 51.64
45%
23Claude Haiku 4.51.64
77%
24Claude Opus 5.51.64
63%
25Qwen3.8 27b1.63
79%
26Claude Opus 5.51.63
62%
27Claude Haiku 4.51.63
71%
28Claude Opus 4.71.62
74%
29Glm 5.31.61
72%
30Gpt 6 Astra1.61
69%
31Claude Sonnet 4.51.59
74%
32Qwen3.7 Max1.57
72%
33Qwen3.6 Plus1.56
72%
34Glm 5.31.54
66%
35Gpt 6 Astra1.54
64%
36Qwen3.5 397b A17b1.53
69%
37Gemini 3.5 Flash Lite1.52
66%
38Qwen3 Max Thinking1.50
63%
39Kimi K2.61.49
65%
40Minimax M31.48
64%
41Grok 4.61.48
66%
42Ox Alpha1.47
65%
43Gpt 6 Luna Pro1.46
59%
44Gpt 6 Sol1.46
54%
45Minimax M31.44
63%
46Gpt 6 Sol Pro1.44
57%
47Grok 4.20 Multi Agent Beta1.43
64%
48Gpt 6 Luna1.43
58%
49Grok 4.20 Multi Agent Beta1.43
67%
50Mimo V2.5 Pro1.42
62%
51Ox Alpha1.42
54%
52Qwen3.6 Plus1.42
59%
53Deepseek V4.1 Flash1.42
57%
54Gemini 3.5 Flash Lite1.41
60%
55Gpt 6 Sol1.41
59%
56Deepseek V4.1 Flash1.41
57%
57Gpt 6 Sol Pro1.38
55%
58Gpt 5.6 Terra1.38
54%
59Gpt 6 Luna1.37
59%
60Gpt 6 Luna Pro1.37
57%
61Grok 4.61.35
56%
62Qwen3.7 Max1.34
57%
63Grok 4.51.32
54%
64Grok 4.51.30
55%
65Grok 4.31.30
50%
66Gpt 5.6 Sol1.30
48%
67Gpt 5.6 Sol1.29
47%
68Grok 4.20 Beta1.27
54%
69Kimi K2.61.27
50%
70Gpt 5.51.27
47%
71Grok 4.20 Beta1.26
56%
72Gpt 5.41.25
48%
73Nemotron 3 Super 120b A12b:Free1.23
54%
74Kimi K2.51.23
52%
75Gpt 5.51.22
45%
76Muse Spark 1.21.21
50%
77Gpt 5.6 Terra1.20
47%
78Gpt 5.51.20
45%
79Gpt 5.6 Luna1.20
41%
80Gpt 5.41.17
42%
81Muse Spark 1.21.15
49%
82Claude 3.7 Sonnet:Thinking1.14
49%
83Qwen3 Max Thinking1.14
46%
84Gpt 5.2 Codex1.14
45%
85Gemini 3 Pro Preview1.13
48%
86Claude Opus 4.11.12
43%
87Nemotron 3 Super 120b A12b1.12
47%
88Grok 4.31.12
46%
89Claude Opus 4.11.12
42%
90Claude 3.5 Haiku1.11
50%
91Gpt 5.21.10
38%
92Gpt 5.5 Pro1.09
34%
93Deepseek V4 Flash 07311.08
39%
94Nemotron 3 Ultra 550b A55b1.07
49%
95Claude 3.5 Sonnet1.07
46%
96Gpt 5.5 Pro1.07
36%
97Gpt 5.6 Luna1.06
37%
98Gpt 5.3 Chat1.06
40%
99Gpt 5.1 Chat1.05
45%
100Gemini 3.1 Pro Preview1.05
37%
101Gpt 5.4 Mini1.05
31%
102Claude 3.7 Sonnet1.03
44%
103Nemotron 3 Super 120b A12b:Free1.02
43%
104Hunter Alpha1.02
43%
105Gpt 5.21.02
28%
106Gpt 5.5 Chat1.01
34%
107Gpt 5 Codex1.01
39%
108Gpt 5.2 Codex1.01
39%
109Claude Opus 40.99
34%
110Deepseek V4 Pro 08130.98
35%
111Gpt 5.4 Mini0.98
32%
112Gpt 5.2 Codex0.97
37%
113Kimi K2.50.95
31%
114Qwen3.8 Max0.95
27%
115Gemini 3 Pro Preview0.94
36%
116Gpt 5.4 Mini0.94
32%
117Nemotron 3 Ultra 550b A55b0.94
40%
118Mimo V2.5 Pro0.94
38%
119Qwen3.8 27b0.94
29%
120Gemini 3.7 Flash0.93
35%
121Deepseek V4 Pro 08130.92
32%
122Gemini 3.6 Flash0.92
39%
123Healer Alpha0.92
37%
124Gpt 5.10.88
25%
125Claude Sonnet 40.87
29%
126Mimo V2.50.87
35%
127Gemini 3.1 Pro Preview0.87
31%
128Hunter Alpha0.86
35%
129Claude Sonnet 40.85
30%
130Gpt 5.1 Codex0.84
32%
131Llama 4 Maverick0.84
29%
132Gpt 5.2 Chat0.83
27%
133Gpt 5.3 Codex0.83
24%
134Gemini 3.7 Flash0.82
31%
135Gpt 50.82
21%
136Gemini 3.6 Flash0.78
28%
137Glm 5 Turbo0.78
31%
138Nemotron 3 Super 120b A12b0.77
31%
139Glm 5.20.75
31%
140Gemma 4.31b It0.74
25%
141Glm 50.73
28%
142Nemotron 3 Nano 30b A3b:Free0.70
28%
143Gpt 5.3 Codex0.69
20%
144Gpt 5.3 Codex0.68
19%
145O30.67
26%
146Healer Alpha0.66
26%
147Deepseek V4 Flash 07310.66
20%
148Gemma 4.26b A4b It0.65
21%
149Gpt 5 Chat0.64
18%
150Mimo V2.50.63
24%
151Qwen3 Coder0.63
20%
152Glm 5 Turbo0.62
23%
153Glm 5.10.61
22%
154Step 3.5 Flash0.60
22%
155Laguna S 2.10.60
21%
156Gemini 2.5 Pro0.60
20%
157Glm 50.59
20%
158Deepseek V4 Flash0.58
18%
159Grok 4.1 Fast0.58
19%
160Deepseek V4 Pro0.57
14%
161Llama 4 Scout0.57
20%
162Llama 3.1 8b Instruct0.57
14%
163Glm 5.20.56
17%
164Gemma 4.31b It0.56
20%
165Gemini 3.5 Flash0.56
20%
166Mimo V2 Flash0.55
16%
167Hy3 Preview:Free0.55
16%
168Gemini 2.5 Flash0.54
19%
169Laguna S 2.10.53
22%
170Gpt 5.4 Nano0.52
14%
171Trinity Large Thinking0.51
17%
172Glm 5.10.50
18%
173Gpt 5.4 Nano0.50
14%
174Gpt 4o 2024.08.060.49
12%
175Gemini 3.5 Flash0.49
19%
176Deepseek V4 Pro0.49
14%
177Gemini 2.0 Flash 0010.48
15%
178Deepseek V3.20.46
13%
179Hy3 Preview:Free0.46
8%
180Minimax M2.50.44
9%
181Gpt 4.10.43
14%
182Step 3.5 Flash0.43
13%
183Trinity Large Thinking0.42
13%
184Gpt 5.4 Nano0.42
10%
185Gemma 4.26b A4b It0.41
11%
186Gemini 3 Flash Preview0.41
10%
187Seed 1.60.41
7%
188Gemini 3.1 Flash Lite Preview0.40
11%
189Gpt Oss 120b0.40
12%
190Deepseek V4 Flash0.40
14%
191Mimo V2 Flash0.40
13%
192Seed 1.60.40
11%
193Deepseek V3.20.40
10%
194Minimax M2.70.40
7%
195Minimax M2.50.39
8%
196Ernie 4.5 Vl 424b A47b0.36
11%
197Claude 3 Haiku0.34
10%
198Deepseek R10.34
7%
199Gemini 3 Flash Preview0.34
10%
200Glm 4.50.34
8%
201Nemotron 3 Nano 30b A3b:Free0.33
10%
202Kimi K20.33
10%
203Minimax M2.70.33
8%
204Mistral Small 26030.33
6%
205Deepseek R10.31
8%
206Qwen3.235b A22b0.31
6%
207Grok 4.1 Fast0.30
10%
208Glm 4.50.30
6%
209Gpt Oss 120b0.30
5%
210O4 Mini0.29
4%
211Ernie 4.5 Vl 424b A47b0.29
3%
212O4 Mini0.28
8%
213Qwen3.235b A22b0.27
3%
214Ernie 4.5 300b A47b0.27
4%
215Nemotron Nano 9b V2:Free0.26
5%
216Nemotron Nano 9b V2:Free0.24
3%
217Intellect 30.23
7%
218Deepseek Chat0.22
4%
219Intellect 30.19
5%
220Jamba Large 1.70.19
5%
221Mistral Large 25120.17
2%
222Mistral Small 26030.16
4%
223Gpt 4o Mini 2024.07.180.16
2%
224Gemma 3.27b It0.15
3%

Så läser du tabellen

Poäng (0–2): snittbetyg från en panel av AI-domare. 2 = modellen genomskådade nonsenset helt, 0 = modellen gick på det. Genomskådat nonsens visar andelen frågor där modellen fick full poäng.

Datan hämtas automatiskt varje dag från det öppna projektet Bullshit Benchmark av Peter Gostev. All ära för metodik och testdata tillhör originalprojektet.

Behöver ni hjälp med AI Act och riskbedömning av AI-verktyg?

Vi hjälper er att klassificera AI-system, upprätta styrdokument och välja rätt verktyg för verksamheten.

Boka säkerhetsanalys

Vi använder cookies

Vi använder nödvändiga cookies för att webbplatsen ska fungera korrekt. Med ditt samtycke använder vi även analytiska cookies för att förstå hur besökare använder webbplatsen, samt marknadsföringscookies för att visa relevanta annonser. Läs mer i vår cookiepolicy.

JH Support AB · GDPR-efterlevnad · Dina val sparas lokalt