Hallo,
Met het oog op de vele AI oplossingen, digitale collega's en agent oplossingen zijn wij op zoek naar meer duidelijkheid over geschiktheid van PDF bestanden. Tegenwoordig is dit vaak al veel meer gestructureerd dan een platte afbeelding met tekst op een vaste locatie.
Dus voor de vraag:
Onder welke voorwaarden wordt een PDF betrouwbaar geïndexeerd door AI Search?
- Is een selecteerbare/doorzoekbare tekstlaag vereist, wordt OCR toegepast op gescande PDF's, en zijn er beperkingen (bestandsgrootte, lay-out, tabellen, kolommen) die de indexeringskwaliteit beïnvloeden?
- Ook ben ik benieuwd welke technieken er eventueel nog worden toegepast voor het indexeren van PDF's; wordt er bijvoorbeeld gebruik gemaakt van layout-analyse modellen, reading-order reconstructie, een PDF --> Markdown pipeline en/of multimodale LLM's?

