top of page

Makkelijk hoor die PDF-bestanden. Alleen niet om te vertalen....

  • Foto van schrijver: Joël Sigling
    Joël Sigling
  • 14 aug
  • 4 minuten om te lezen

Regelmatig krijgen we het verzoek om een PDF-bestand met tekst te vertalen. Klanten denken vaak dat het geen probleem moet zijn om die te vertalen. Helaas is dat meestal niet het geval. Er bestaat namelijk geen software die PDF als eigen, native bestandsformaat gebruikt. Elk PDF-bestand is afkomstig uit een ander programma of apparaat.


Twee soorten PDF-bestanden

Een PDF ontstaat op twee manieren: softwarematig, vanuit een ander digitaal bestand, of hardwarematig, via een scanner of camera. Voor vertaaldoeleinden is dit onderscheid cruciaal:

  • Type 1 – De PDF is gegenereerd vanuit een bestand met bewerkbare tekst (bijvoorbeeld Word of InDesign).

  • Type 2 – De PDF bevat geen bewerkbare tekst. Dit gebeurt in twee gevallen: de PDF is gemaakt van een afbeeldingsbestand (JPG, PNG, AI) met tekst erin, of een fysiek document is gescand of gefotografeerd. In beide gevallen staat de tekst als afbeelding in het bestand en zijn ze technisch gezien vergelijkbaar met elkaar.


Waarom dit onderscheid ertoe doet

Bij Type 1-bestanden is het bronbestand vaak nog beschikbaar. Dat heeft altijd de voorkeur: het kan snel en efficiënt vertaald worden, met behoud van de originele opmaak.

Is het bronbestand niet meer voorhanden, of alleen in een formaat dat vertaalsoftware niet aankan, dan moet de bewerkbare tekst eerst uit de PDF gehaald worden. Sommige vertaaltools kunnen dit direct verwerken, met als voordeel dat herhalingen binnen of tussen documenten hergebruikt kunnen worden. Het nadeel: de opmaak wijkt vrijwel altijd af van het origineel. Voor bestanden met veel opmaak is dat vaak onwenselijk.


Opmaakproblemen bij rechtstreeks vertaalde PDF's

Wanneer een PDF rechtstreeks in de vertaaltool wordt vertaald, ontstaan er dus geregeld opmaakproblemen. Vertaalde tekst is vaak langer of korter dan de brontekst en past dan niet meer binnen de beschikbare ruimte. Tabellen zijn hier bijvoorbeeld extra gevoelig voor en zijn berucht om de vele problemen die ze veroorzaken bij de omzetting naar tekst.


In zulke gevallen is het vaak efficiënter om de tekst eerst uit de PDF te extraheren en pas daarna te vertalen. De opmaak gaat dan verloren, maar deze opnieuw opbouwen in bijvoorbeeld Word is doorgaans eenvoudiger dan een rechtstreeks vertaalde PDF weer netjes krijgen.


OCR: tekst uit scans halen

Voor Type 2-bestanden is OCR-software (Optical Character Recognition) onmisbaar. Deze techniek herkent tekst in afbeeldingen en zet die om naar bewerkbare tekst.

De kwaliteit van het OCR-resultaat hangt sterk af van de kwaliteit van het bronbestand. Is een scan donker of onscherp, dan kan de OCR onbetrouwbaar of zelfs onbruikbaar zijn. De vertaler moet in het ergste geval de tekst handmatig overtypen vanaf beeldscherm of print. Gelukkig hebben steeds meer vertaaltools ingebouwde OCR-functionaliteit, wat tijd en moeite bespaart.


Gebruik van AI bij het verwerken van gescande PDF's

Recente ontwikkelingen op het gebied van AI hebben de functionaliteit voor het verwerken van gescande PDF's flink uitgebreid. AI biedt tegenwoordig mogelijkheden die de traditionele OCR-programma's nog niet of in mindere mate hadden:


  • Slimmere tekstherkenning: AI-gedreven OCR-modellen zijn beter bestand tegen lastige omstandigheden zoals slechte scankwaliteit, ongebruikelijke lettertypen, handschrift of gekantelde/vervormde documenten. Ze "raden" op basis van context vaak correcter dan traditionele OCR-engines.

  • Structuur en opmaak beter behouden: waar klassieke OCR vaak de plank missloeg qua opmaak, kunnen moderne AI-tools de lay-out beter omzetten: kolommen, tabellen, kopjes en alinea's worden beter nagemaakt in een bewerkbaar formaat, zoals Word of HTML. Dit scheelt veel handwerk bij het herstellen van de opmaak.

  • Taalcontext en foutcorrectie: AI-modellen kunnen tekst niet alleen herkennen, maar ook beoordelen of een herkend woord taalkundig logisch is binnen de zin, waardoor evidente OCR-fouten (bijvoorbeeld verwisselde tekens) vaker automatisch gecorrigeerd worden.

  • Combinatie met vertaling: sommige moderne workflows combineren tekstherkenning en vertaling in één stap, wat efficiënter kan zijn dan de traditionele volgorde van eerst extraheren en dan vertalen. Toch is het beter om het OCR-resultaat eerst te controleren, want er kunnen nog altijd fouten in staan. En die wil je niet meenemen naar de vertaling.


In de moderne gespecialiseerde OCR-tools zijn deze mogelijkheden meestal ook ingebouwd. Belangrijk om te beseffen: ook AI kan zeker niet alle PDF-bestanden feilloos omzetten. Lage beeldkwaliteit, minder gangbare talen en complexe lay-out zorgen voor een OCR-resultaat dat nog nauwkeurig door de mens moet worden gecontroleerd en gecorrigeerd. Deze tools versnellen het proces wel in elk geval.


Wat kun je zelf doen als je een PDF wilt laten vertalen?

  1. Ga eerst na of er een origineel bestand bestaat waarmee de PDF is gemaakt (Word, Excel, PowerPoint, InDesign, enzovoort). Deze route heeft altijd de voorkeur, zeker ook voor je vertaalbureau.

  2. Heb je dat bronbestand niet, houd er dan rekening mee dat de opmaak van de vertaling zelden 100% overeenkomt met het origineel. Bevat het document niet-bewerkbare tekst (bijvoorbeeld door scannen), dan kan dit de doorlooptijd en prijs van de vertaling beïnvloeden.

  3. Ga er niet vanuit dat alle PDF's gelijk zijn of eenvoudig te vertalen. De variatie is enorm ook in de hoeveel werk die nodig is om ze klaar te maken voor vertaling.


Een professionele vertaalpartner weet hoe je met de verschillende soorten PDF-bestanden omgaat en wat de meest efficiënte en kosteneffectieve manier is om ze te vertalen. Stuur gerust een mail naar joel.sigling@interlingo.nl als je meer wilt weten.

 
 
 

Recente blogposts

Alles weergeven

Opmerkingen


bottom of page