Skip to main content
Beantwoord

Hoe worden PDF bestanden geïndexeerd voor Zenya AI Search?

  • August 6, 2026
  • 5 reacties
  • 43 Bekeken

Forum|alt.badge.img

Hallo,

Met het oog op de vele AI oplossingen, digitale collega's en agent oplossingen zijn wij op zoek naar meer duidelijkheid over geschiktheid van PDF bestanden. Tegenwoordig is dit vaak al veel  meer gestructureerd dan een platte afbeelding met tekst op een vaste locatie.

Dus voor de vraag:

Onder welke voorwaarden wordt een PDF betrouwbaar geïndexeerd door AI Search?

  • Is een selecteerbare/doorzoekbare tekstlaag vereist, wordt OCR toegepast op gescande PDF's, en zijn er beperkingen (bestandsgrootte, lay-out, tabellen, kolommen) die de indexeringskwaliteit beïnvloeden?
  • Ook ben ik benieuwd welke technieken er eventueel nog worden toegepast voor het indexeren van PDF's; wordt er bijvoorbeeld gebruik gemaakt van layout-analyse modellen, reading-order reconstructie, een PDF --> Markdown pipeline en/of multimodale LLM's?

Antwoord op het topic hleijen

@Sakkers   bij deze een wat uitgebreidere toelichting

 

Hoe het werkt

We halen de tekstlaag uit de PDF en indexeren die. Voor verreweg de meeste PDF's werkt dat goed: alles wat digitaal is aangemaakt — een export vanuit Word, een uitdraai uit een ander systeem, een handleiding uit InDesign — bevat een tekstlaag met de tekens en hun positie op de pagina. Die tekst is volledig doorzoekbaar en bruikbaar als bron voor AI-antwoorden.

Is een selecteerbare tekstlaag vereist?

Ja. Je kunt dat zelf in tien seconden controleren: open de PDF, Ctrl+A, Ctrl+C, plakken in Kladblok. Krijg je leesbare tekst, dan is dat ongeveer wat wij ook zien. Krijg je niets, dan bestaat de pagina uit beeld. In dat geval kunnen mensen de PDF prima lezen, maar kunnen we het document niet doorzoeken en kan onze AI er ook geen antwoorden op baseren.  
 

Wordt OCR toegepast op scans?

Op dit moment niet. Een gescand document zonder tekstlaag levert dus geen inhoud op in de index. 
 

Wat beïnvloedt de kwaliteit verder?

  • Lopende tekst in één kolom komt er het schoonst uit. 
  • Meerkolomsopmaak, zijbalken, kop- en voetteksten kunnen door elkaar heen lopen, omdat de leesvolgorde niet in het PDF-formaat is vastgelegd maar uit de opslagvolgorde volgt.
  • Tabellen komen als tekst binnen, maar de rij-/kolomrelatie gaat verloren. Zoeken op een term uit een tabel werkt; een vraag als "wat staat er in rij 4, kolom 3" is niet betrouwbaar.
    Bij eenvoudige tabellen hoeft dat in de praktijk niet meteen voor problemen te zorgen
    Stel je een tabel voor met kolom 1 “diernaam” en kolom 2 “soort dier” - dan blijkt proefondervindelijk dat de vraag ‘tot welke soort dier behoort ...’ correct beantwoord wordt. Maar in het algemeen geldt: hoe complexer de tabel, des te lager de betrouwbaarheid van antwoorden die op zo'n document gebaseerd worden. 
  • Stroomschema's, beslisbomen en grafieken zijn tekeningen. Losse labels komen mogelijk mee, de logica van het schema niet.
     

Welke technieken gebruiken we?

We gebruiken tekstlaag-extractie, en op dit moment geen layout-analysemodellen, reading-order-reconstructie, of multimodale LLM's. Dit werkt snel en (kosten)efficient.
We zijn ons bewust van de beschikbaarheid van meer geavanceerde technieken, en bekijken met enige regelmaat of de ontwikkelingen op dit vlak ver genoeg gevorderd zijn om dit betrouwbaar en kosten-efficient in te zetten in Zenya.   
Op dit moment heb ik daar geen concreet nieuws over te melden.

Waar je vandaag het meeste rendement haalt

  1. Kijk eerst of het document überhaupt als PDF in Zenya moet staan. 
    Heb je het origineel ook in Word? Zet dan dat bestand in Zenya. Zenya kan voor de weergave automatisch een PDF genereren, terwijl het bronformaat — en dus wat we indexeren en doorzoeken — Word blijft.
    In een Word-bestand liggen koppen, lijsten en tabellen expliciet vast; in een PDF is die structuur alleen zichtbaar voor het oog en moet software het afleiden. Dat scheelt merkbaar in de kwaliteit van zoekresultaten en AI-antwoorden.
  2. Moet het toch PDF zijn, lever hem dan born-digital aan.
    (met gevulde tekstlaag)
  3. Zet inhoud die er echt toe doet in tekst, niet (alleen) in een afbeelding of een schema.

Kort samengevat: een PDF is een presentatieformaat. Hoe dichter je bij het oorspronkelijke, gestructureerde document blijft, hoe beter alles wat daarna komt — zoeken, verwijzen en AI-antwoorden — werkt.

 

5 reacties

Chaim Leunissen
Forum|alt.badge.img+5

@Sakkers 

Allereerst welkom op de Zenya Community!

AI Search maakt gebruik van de reeds bestaande indexering die er nu al voor zorgt dat PDF documenten gevonden kunnen worden. Kortom: PDF documenten kunnen zowel met de 'klassieke’ zoekfunctie als met AI Search gevonden worden.


Forum|alt.badge.img
  • Auteur
  • Ontdekker
  • August 7, 2026

Bedankt voor het welkom en de reactie Chaim.

Mijn vraag is meer bedoeld om te achterhalen onder welke voorwaarden welke informatie uit een PDF betrouwbaar wordt geïndexeerd. Kan dit nog toegelicht worden aan de hand van mijn eerdere vragen?


Chaim Leunissen
Forum|alt.badge.img+5

Alle tekst in een standaard PDF wordt geïndexeerd. Ik draai de vraag daarom om: hebben jullie de ervaring dat PDF's niet gevonden worden?

Daarnaast wil ik ook onderscheid maken tussen de indexering en de zoektechniek. De indexering vindt altijd op exact dezelfde wijze plaats, ongeacht of je de klassieke zoekfunctie of AI Search gebruikt.

Kun je aangeven waar de kern van je vraag zit? Ik heb de indruk dat je bang bent dat PDF documenten niet vindbaar zijn.


hleijen
Forum|alt.badge.img+7
  • Zenya medewerker
  • Antwoord
  • September 3, 2026

@Sakkers   bij deze een wat uitgebreidere toelichting

 

Hoe het werkt

We halen de tekstlaag uit de PDF en indexeren die. Voor verreweg de meeste PDF's werkt dat goed: alles wat digitaal is aangemaakt — een export vanuit Word, een uitdraai uit een ander systeem, een handleiding uit InDesign — bevat een tekstlaag met de tekens en hun positie op de pagina. Die tekst is volledig doorzoekbaar en bruikbaar als bron voor AI-antwoorden.

Is een selecteerbare tekstlaag vereist?

Ja. Je kunt dat zelf in tien seconden controleren: open de PDF, Ctrl+A, Ctrl+C, plakken in Kladblok. Krijg je leesbare tekst, dan is dat ongeveer wat wij ook zien. Krijg je niets, dan bestaat de pagina uit beeld. In dat geval kunnen mensen de PDF prima lezen, maar kunnen we het document niet doorzoeken en kan onze AI er ook geen antwoorden op baseren.  
 

Wordt OCR toegepast op scans?

Op dit moment niet. Een gescand document zonder tekstlaag levert dus geen inhoud op in de index. 
 

Wat beïnvloedt de kwaliteit verder?

  • Lopende tekst in één kolom komt er het schoonst uit. 
  • Meerkolomsopmaak, zijbalken, kop- en voetteksten kunnen door elkaar heen lopen, omdat de leesvolgorde niet in het PDF-formaat is vastgelegd maar uit de opslagvolgorde volgt.
  • Tabellen komen als tekst binnen, maar de rij-/kolomrelatie gaat verloren. Zoeken op een term uit een tabel werkt; een vraag als "wat staat er in rij 4, kolom 3" is niet betrouwbaar.
    Bij eenvoudige tabellen hoeft dat in de praktijk niet meteen voor problemen te zorgen
    Stel je een tabel voor met kolom 1 “diernaam” en kolom 2 “soort dier” - dan blijkt proefondervindelijk dat de vraag ‘tot welke soort dier behoort ...’ correct beantwoord wordt. Maar in het algemeen geldt: hoe complexer de tabel, des te lager de betrouwbaarheid van antwoorden die op zo'n document gebaseerd worden. 
  • Stroomschema's, beslisbomen en grafieken zijn tekeningen. Losse labels komen mogelijk mee, de logica van het schema niet.
     

Welke technieken gebruiken we?

We gebruiken tekstlaag-extractie, en op dit moment geen layout-analysemodellen, reading-order-reconstructie, of multimodale LLM's. Dit werkt snel en (kosten)efficient.
We zijn ons bewust van de beschikbaarheid van meer geavanceerde technieken, en bekijken met enige regelmaat of de ontwikkelingen op dit vlak ver genoeg gevorderd zijn om dit betrouwbaar en kosten-efficient in te zetten in Zenya.   
Op dit moment heb ik daar geen concreet nieuws over te melden.

Waar je vandaag het meeste rendement haalt

  1. Kijk eerst of het document überhaupt als PDF in Zenya moet staan. 
    Heb je het origineel ook in Word? Zet dan dat bestand in Zenya. Zenya kan voor de weergave automatisch een PDF genereren, terwijl het bronformaat — en dus wat we indexeren en doorzoeken — Word blijft.
    In een Word-bestand liggen koppen, lijsten en tabellen expliciet vast; in een PDF is die structuur alleen zichtbaar voor het oog en moet software het afleiden. Dat scheelt merkbaar in de kwaliteit van zoekresultaten en AI-antwoorden.
  2. Moet het toch PDF zijn, lever hem dan born-digital aan.
    (met gevulde tekstlaag)
  3. Zet inhoud die er echt toe doet in tekst, niet (alleen) in een afbeelding of een schema.

Kort samengevat: een PDF is een presentatieformaat. Hoe dichter je bij het oorspronkelijke, gestructureerde document blijft, hoe beter alles wat daarna komt — zoeken, verwijzen en AI-antwoorden — werkt.

 


Forum|alt.badge.img
  • Auteur
  • Ontdekker
  • September 3, 2026

Enorm bedankt Hilbert, hier kan ik goed mee verder!