Nyílt modellek minden korszakban feleannyi idő alatt zárkóznak fel
Az elmúlt két hónap áttörést hozott a nyílt forráskódú mesterséges intelligencia számára. A GLM 5.3 és a Kimi K3 már valóban képesek azokra a kódolási és ügynöki feladatokra, amelyek az Anthropicot több mint 65 milliárd dolláros ARR-hez juttatták, ellentétben a 2025 januári DeepSeek R1-gyel, amelyet senki sem használt gazdaságilag értékes munkára. A Fireworks önmagában napi több mint 40 billió tokent dolgoz fel, ami kétszerese az OpenAI API március végi volumenének. A verseny immár túlnyúlik az OpenAI–Anthropic duopóliumon, miközben felmerül, hogy a modellréteg kommoditizálódhat.
A SemiAnalysis három korszakot különböztet meg, és minden korszak modelljeit a saját korabeli benchmarkjain mérte. A korai skálázás idején a Llama-2-70B-től a Llama-3.1-405B 2024 júliusi megjelenéséig tartott a GPT-3.5 Turbohoz mért szakadék bezárása, a GPT-4o-t pedig a DeepSeek V3 érte utol 2024 decemberében. A reasoning korszakban a DeepSeek R1 már csak 12,1 pontos lemaradással indult, és az R1-0528 8,5 hónap alatt zárta a szakadékot. Az ügynöki korszakban a Kimi K2.6 4,8 hónap alatt megelőzte az Opus 4.5-öt, a GLM-5.2 pedig hat hónap alatt a GPT-5.2-t, így a felzárkózási idő korszakonként nagyjából feleződik.
A SemiAnalysis szerint a benchmarkok nem fedik le a teljes képet, mert a nyilvános teszteket a modellkészítők könnyen fel tudják tornászni, és ők maguk is a Fable-t részesítik előnyben a napi munkában. Az Anthropic a Claude Code és a Claude Tag révén jobban termékesítette a modelljét, és immár a teljes ügynöki termék, a modell plusz a harness számít igazán. A harmadik korszakban az OpenAI és az Anthropic átlagosan 51 naponta adott ki új modellt, szemben az első korszak 213 és a második 120 napos átlagával. A szerzők szerint a gyorsuló felzárkózás kevésbé negatív a frontier laboratóriumokra nézve, mint elsőre gondolnánk.