Het probleem: je model ziet een kleinere foto dan jij
Upload je een foto van 4000 pixels breed naar een AI-model, dan is de kans groot dat het model die foto nooit op die resolutie te zien krijgt. Beelden worden vóór verwerking verkleind. Voor de grote lijn maakt dat niets uit: een kamer blijft een kamer. Maar het serienummer op een sticker, de kleine tekst op een verpakking of de haarscherpe rand van een product verdwijnt in die verkleining.
Dat verklaart een frustratie die veel mensen herkennen: je vraagt wat er op een label staat, en je krijgt een antwoord dat klopt qua vorm maar niet qua inhoud. Het model verzint geen onzin uit luiheid — het heeft die pixels simpelweg nooit gezien.
De oplossing die Anthropic beschrijft
Anthropic werkte hun cookbook voor een zoom-tool bij. Het idee is eenvoudig: in plaats van het model één verkleinde afbeelding te geven, geef je het de mogelijkheid om een gebied op te vragen. Het model zegt welk deel het beter wil zien, en krijgt die uitsnede terug uit het origineel op volledige resolutie.
Het is dus geen slimmer model, maar een slimmere werkwijze. Vergelijk het met iemand die een kaart bekijkt: eerst het overzicht, dan inzoomen op de straat die je nodig hebt. Precies wat je zelf zou doen, alleen dan als tool die het model mag aanroepen.
Wanneer dit je werk echt scheelt
Niet elke taak heeft dit nodig. Vraag je om een sfeerbeschrijving of een algemene beoordeling van compositie, dan is een verkleinde versie prima. Het verschil ontstaat zodra het antwoord afhangt van iets kleins in een grote afbeelding.
- Tekst of codes uitlezen van verpakkingen, labels, bonnetjes of typeplaatjes.
- Productfoto's controleren op afwijkingen, krassen of verkeerde varianten.
- Schermafbeeldingen van dashboards waarin de cijfers klein staan.
- Detailcontrole op AI-gegenereerd beeld: handen, tekst in beeld en randen.
Wat het kost
Eerlijk blijven: elke uitsnede is een extra afbeelding die verwerkt wordt, en dus extra tokens. Een model dat vijf keer inzoomt op één foto gebruikt merkbaar meer dan een model dat één verkleinde versie bekijkt. Bij losse vragen valt dat weg in de ruis; bij een batch van duizend productfoto's telt het op.
De afweging is dus niet 'zoomen is beter', maar: is het detail waar je naar vraagt belangrijk genoeg om die extra ronde te betalen? Bij controlewerk waar een fout je een retour of een verkeerde bestelling kost, is dat antwoord meestal ja.
Wat je hier vandaag mee kunt
Werk je zelf met AI-beelden, dan is de praktische les breder dan deze ene tool. Verklein je bronbestand niet voordat je het nodig hebt, bewaar het origineel, en wees achterdochtig als een model iets kleins met stelligheid beweert. Vraag door, of laat het de betreffende hoek nog eens apart bekijken.
Voor wie beelden maakt in plaats van beoordeelt geldt hetzelfde omgekeerd: lever detail aan op de plek waar het telt. Een scherp uitgesneden productbeeld is bruikbaarder dan een enorme foto waarin het product klein in beeld staat.
Bronnen
Bron: @ClaudeDevs op X over de bijgewerkte zoom tool-cookbook (23 juli 2026).
Veelgestelde vragen
Waarom leest AI kleine tekst op mijn foto verkeerd?
Grote afbeeldingen worden meestal verkleind voordat het model ze verwerkt. Kleine tekst overleeft die verkleining vaak niet, waardoor het model een plausibele gok doet in plaats van te lezen wat er staat.
Wat doet een zoom-tool precies?
Die laat het model een gebied in de afbeelding opvragen. Dat gebied wordt uit het origineel op volledige resolutie geknipt en teruggegeven, zodat het model het detail alsnog scherp ziet.
Kost inzoomen extra?
Ja. Elke uitsnede is een extra afbeelding en dus extra tokens. Bij losse vragen merk je dat nauwelijks, bij grote batches wel.
Heb ik dit nodig voor gewone AI-beelden maken?
Voor het genereren zelf niet. Het is nuttig bij controle achteraf: handen, tekst in beeld en scherpe randen beoordeel je beter op volledige resolutie.