DApp Store | Web3 Hub für Ereignisse und Spiele

Trend-Themen

Lächerlich, dass OpenAI 74,9 % auf SWE-Bench behauptet hat, nur um zu beweisen, dass sie über den 74,5 % von Opus 4.1 liegen... Indem sie es an 477 Problemen statt an den vollen 500 getestet haben. Ihre Systemkarte sagt auch nur 74 %.

Quelle:

Und ja, ich weiß, dass sie immer über den 477 Nenner berichtet haben, aber das ist NICHT „SWE-Bench verifiziert“, das ist eine ganz andere Kennzahl, es ist „OpenAIs Teilmenge von SWE Bench Verified“ und diese Zahl kann nicht verglichen werden.

23,18K

Top

Ranking

Favoriten

Onchain-Trends

Im Trend auf X

Aktuelle Top-Finanzierungen

Am bemerkenswertesten