@Sakkers bij deze een wat uitgebreidere toelichting
Hoe het werkt
We halen de tekstlaag uit de PDF en indexeren die. Voor verreweg de meeste PDF's werkt dat goed: alles wat digitaal is aangemaakt — een export vanuit Word, een uitdraai uit een ander systeem, een handleiding uit InDesign — bevat een tekstlaag met de tekens en hun positie op de pagina. Die tekst is volledig doorzoekbaar en bruikbaar als bron voor AI-antwoorden.
Is een selecteerbare tekstlaag vereist?
Ja. Je kunt dat zelf in tien seconden controleren: open de PDF, Ctrl+A, Ctrl+C, plakken in Kladblok. Krijg je leesbare tekst, dan is dat ongeveer wat wij ook zien. Krijg je niets, dan bestaat de pagina uit beeld. In dat geval kunnen mensen de PDF prima lezen, maar kunnen we het document niet doorzoeken en kan onze AI er ook geen antwoorden op baseren.
Wordt OCR toegepast op scans?
Op dit moment niet. Een gescand document zonder tekstlaag levert dus geen inhoud op in de index.
Wat beïnvloedt de kwaliteit verder?
- Lopende tekst in één kolom komt er het schoonst uit.
- Meerkolomsopmaak, zijbalken, kop- en voetteksten kunnen door elkaar heen lopen, omdat de leesvolgorde niet in het PDF-formaat is vastgelegd maar uit de opslagvolgorde volgt.
- Tabellen komen als tekst binnen, maar de rij-/kolomrelatie gaat verloren. Zoeken op een term uit een tabel werkt; een vraag als "wat staat er in rij 4, kolom 3" is niet betrouwbaar.
Bij eenvoudige tabellen hoeft dat in de praktijk niet meteen voor problemen te zorgen
Stel je een tabel voor met kolom 1 “diernaam” en kolom 2 “soort dier” - dan blijkt proefondervindelijk dat de vraag ‘tot welke soort dier behoort ...’ correct beantwoord wordt. Maar in het algemeen geldt: hoe complexer de tabel, des te lager de betrouwbaarheid van antwoorden die op zo'n document gebaseerd worden. - Stroomschema's, beslisbomen en grafieken zijn tekeningen. Losse labels komen mogelijk mee, de logica van het schema niet.
Welke technieken gebruiken we?
We gebruiken tekstlaag-extractie, en op dit moment geen layout-analysemodellen, reading-order-reconstructie, of multimodale LLM's. Dit werkt snel en (kosten)efficient.
We zijn ons bewust van de beschikbaarheid van meer geavanceerde technieken, en bekijken met enige regelmaat of de ontwikkelingen op dit vlak ver genoeg gevorderd zijn om dit betrouwbaar en kosten-efficient in te zetten in Zenya.
Op dit moment heb ik daar geen concreet nieuws over te melden.
Waar je vandaag het meeste rendement haalt
- Kijk eerst of het document überhaupt als PDF in Zenya moet staan.
Heb je het origineel ook in Word? Zet dan dat bestand in Zenya. Zenya kan voor de weergave automatisch een PDF genereren, terwijl het bronformaat — en dus wat we indexeren en doorzoeken — Word blijft.
In een Word-bestand liggen koppen, lijsten en tabellen expliciet vast; in een PDF is die structuur alleen zichtbaar voor het oog en moet software het afleiden. Dat scheelt merkbaar in de kwaliteit van zoekresultaten en AI-antwoorden. - Moet het toch PDF zijn, lever hem dan born-digital aan.
(met gevulde tekstlaag) - Zet inhoud die er echt toe doet in tekst, niet (alleen) in een afbeelding of een schema.
Kort samengevat: een PDF is een presentatieformaat. Hoe dichter je bij het oorspronkelijke, gestructureerde document blijft, hoe beter alles wat daarna komt — zoeken, verwijzen en AI-antwoorden — werkt.