Jev haalt 49 uit 49 met WebMCP: wat deze benchmark betekent voor je website
Jev met Mercury 2.5 lost via WebMCP alle 49 WindTunnel-taken op, tegen lage modelkosten. Maar 49/49 betekent niet dat iedere poging slaagt. De concrete les: onderzoek naast het model ook je toolontwerp, en vergelijk betrouwbaarheid en kosten met dezelfde meetlat.
Een AI-agent verbeteren begint niet altijd bij een groter model. Soms zit de winst in de manier waarop je website zijn functies aanbiedt. Nieuwe WindTunnel-resultaten geven daarvoor een opvallend aanknopingspunt. Ze laten ook zien waarom je ‘100% opgelost’ en ‘245 keer goedkoper’ niet zonder uitleg moet overnemen.
Wat is er getest?
Op 18 september 2026 verscheen WindTunnel-versie 1.2, met Jev en Mercury 2.5 als nieuwe combinatie. De benchmark in de Nekuda-repository omvat 49 taken op acht lokaal draaiende opensource-apps, waaronder een webshop en afsprakenplanner. De testomgeving levert WebMCP-implementaties mee; het gaat niet om acht willekeurige publieke websites die deze ondersteuning zelf aanbieden.
Elke configuratie krijgt drie pogingen per taak. Een taak telt als opgelost wanneer minstens twee pogingen slagen. Jev met WebMCP haalt daardoor 49/49, terwijl 141 van de 147 afzonderlijke pogingen slagen: 95,9%. GPT-6 Astra met codegestuurde browserbediening haalt in deze meting wél 147/147.
| Configuratie | Taken opgelost | Pogingen geslaagd | Mediane modelkosten per poging, USD |
|---|---|---|---|
| Jev + Mercury, WebMCP | 49/49 | 141/147 | $0,001064 |
| Jev + Mercury, aangepaste Ultrafast/DOM | 25/49 | 76/147 | $0,000778 |
| GPT-6 Astra, codegestuurde browserbediening | 49/49 | 147/147 | $0,118676 |
| GPT-6 Astra, screenshots | 45/49 | 135/147 | $0,260780 |
| GPT-6 Astra, WebMCP | 49/49 | 146/147 | $0,017100 |
Deze cijfers hebben we herberekend uit de gepubliceerde meetgegevens. De mediaan is de middelste waarde van 147 pogingen, inclusief mislukte taakpogingen. We hebben de benchmark niet zelf opnieuw uitgevoerd.
Jev kiest; Mercury vult aan
De taakverdeling is interessant. Jev kiest uit beschikbare acties; bij WebMCP zijn dat de tools van de website. Mercury 2.5 schrijft de benodigde argumenten, zoals een zoekterm, en het uiteindelijke antwoord. De gepubliceerde opstelling gebruikt Jev 1.13.0 en Mercury 2.5.
Zonder WebMCP kiest Jev uit paginabediening zoals knoppen en invoervelden, via een aangepaste versie van Browser Use’s Ultrafast. Die configuratie lost 25/49 taken op. Dat is een resultaat van deze implementatie en testset, geen universele grens van Jev of Browser Use.
De plausibele verklaring: een betekenisvolle tool kan verschillende navigatie- en invoerstappen vervangen door één gerichte actie. Maar de twee opstellingen verschillen ook in uitvoeringssoftware. Dit experiment is daarom geen zuivere test waarin uitsluitend WebMCP aan of uit wordt gezet.
Wat betekenen 112× en 245× goedkoper?
De ongeronde medianen verklaren de opvallende claims: de modelkosten van Jev met WebMCP zijn ongeveer 1/112 van Astra met codebediening en 1/245 van Astra met screenshots. Dat vergelijkt complete configuraties, niet alleen modellen. De tabel laat bovendien zien dat ook Astra zelf met WebMCP lagere modelkosten heeft dan met beide andere bedieningsvormen.
De claim ‘18% goedkoper dan Jev zonder WebMCP’ gebruikt een ándere maat: de totale bekende modelkosten van alle 147 gescoorde pogingen dalen van circa $0,2454 naar $0,2016. De mediane poging wordt juist duurder. Dat kan samengaan: de middelste waarde vertelt niets over hoe zwaar enkele dure pogingen in het totaal wegen.
Het betreft geschatte modelkosten op basis van gerapporteerd tokengebruik en prijslijsten, inclusief cachetarieven. Onbekend gebruik staat apart als reserve; infrastructuurherstel zit niet in deze gescoorde totalen. Ontwikkeling, hosting en onderhoud ontbreken eveneens. Dit is dus geen belofte dat je bedrijfsproces 112 keer goedkoper wordt. Zie de kostenverantwoording.
Een benchmark is nog geen klantomgeving
De methodologie noemt belangrijke beperkingen. Dit is een publieke ontwikkelset, geen afgeschermde test met ongepubliceerde opdrachten. Bij 41 taken wordt het antwoord beoordeeld; bij acht wordt de applicatiestatus gecontroleerd. De makers erkennen dat zichtbare testgegevens mogelijk uit training herinnerd kunnen worden.
Ook zijn de configuraties niet gelijktijdig gemeten: de Jev-pogingen dateren van 17–18 september, de hier vergeleken Astra-pogingen van 5–6 september. Open code maakt controle mogelijk, maar veranderende modeldiensten garanderen geen identieke herhaling.
De praktische les: maak de taak expliciet
Een fictief voorbeeld: voor een afspraak moet een agent normaal een kalender openen, een maand kiezen en tijden vergelijken. Een tool als zoek_beschikbare_afspraken kan die zoektocht rechtstreeks aanbieden. De complexiteit verdwijnt niet: je applicatie moet beschikbaarheid, invoer en rechten blijven controleren. Boeken vraagt een afzonderlijk gecontroleerd resultaat.
Ons advies: vergelijk voor één klanttaak zowel de interface als het model. Meet correcte eindresultaten, mislukte pogingen, totale modelkosten, herstelwerk en onderhoud afzonderlijk. De belangrijkste les is niet dat grotere modellen overbodig zijn, maar dat je toolontwerp net zo goed onderzoek verdient als je modelkeuze.
Bronnen
- WebMCP.com — WindTunnel-benchmark v1.2, gepubliceerd 18 september 2026
- WindTunnel — meetgegevens, vastgezette revisie 5ca8644 van 18 september 2026
- WindTunnel — Jev- en Mercury-opstelling en grenzen aan reproductie
- WindTunnel — kosten, herkomst en verantwoording van de Jev-release
- WindTunnel — methode, beoordeling en beperkingen van de ontwikkelset
- WindTunnel — herkomst en verschillende meetperiodes van de configuraties
Lees ook
Benieuwd hoe jouw site ervoor staat? Doe de gratis AI-Ready Scan, of lees het verschil tussen WebMCP, MCP en llms.txt.