Internationale bedrijfsstrategie vereist tegenwoordig dat content tussen talen beweegt met snelheden die vertaalteams in elk voorgaand decennium zouden hebben overweldigd.
Machinevertaling (MT) is nu essentieel voor hoe enterprise content schaalt, maar de vertaalkwaliteit die het levert kan inconsistent zijn.
MT-output varieert per taalpaar, contenttype en workflow, zelfs binnen één project. Die variatie is belangrijker dan de gemiddelde kwaliteitsscore, omdat de tijd die wordt besteed aan het corrigeren van één inconsistente reeks over content met hoge zichtbaarheid de efficiëntiewinst die MT de moeite waard maakte, uitwist.
Elk lokalisatieprogramma voor ondernemingen staat voor dezelfde afwegingen bij het omzetten van MT op schaal: snelheid versus vloeiendheid, kosten versus kwaliteit, schaal versus controle.
Platforms die zijn gebouwd voor MT-kwaliteitsbeheer zetten variabele output om in betrouwbare vertalingen door middel van terminologiecontroles, geautomatiseerde beoordelingspaden en consistente metingen.
Smartling is zo'n platform, en dit artikel legt uit wat MT-kwaliteit eigenlijk is, hoe je die meet en hoe je het consistent kunt houden naarmate het contentvolume groeit.
Wat is de kwaliteit van een machinale vertaling?
De kwaliteit van machinevertaling verwijst naar hoe nauwkeurig en natuurlijk vertaalde inhoud de betekenis van de oorspronkelijke tekst weerspiegelt. Kwaliteitsmaatstaven omvatten nauwkeurigheid, vloeiendheid en consistentie.
De kwaliteit van MT varieert afhankelijk van het taalpaar, het inhoudstype en hoe goed de vertaalworkflow rondom beide is opgebouwd.
Bijvoorbeeld:
- Marketing van content die toonaanpassing vereist, roept andere kwaliteitsverwachtingen op dan technische documentatie die terminologie precisie vereist.
- Een taalpaar met overvloedige trainingsdata levert een andere basisoutput op dan een met beperkte data.
Wat bepaalt de kwaliteit van de machinevertaling
Vijf factoren bepalen of een MT-motor bruikbare output levert voor een bepaalde taak.
Taalpaarcomplexiteit. Sommige paren zoals Engels-Spaans en Engels-Frans hebben decennia aan hoogwaardige trainingsdata. Anderen hebben veel minder, en de kwaliteit van de MT-output weerspiegelt dat graad.
Inhoudstype. Technische documentatie vereist terminologieprecisie. Marketingteksten hebben tonale aanpassing nodig. Juridische inhoud vereist beide, plus letterlijke trouw. Machinevertaling, die niet genoeg nuance heeft, presteert niet gelijkwaardig in alle drie.
Context beschikbaarheid. MT-engines die toegang hebben tot omliggende segmenten, documentstructuur en visuele context leveren betere output dan engines die strings geïsoleerd vertalen .
Trainingsdata Modellen die getraind zijn op domeinspecifieke en merkspecifieke data presteren beter dan algemene engines voor gespecialiseerde content.
Motor- of modelkeuze. Alleen vertrouwen op algemene MT voor elk contenttype en taalpaar zal geen consistente, hoogwaardige resultaten opleveren. LLM's, fine-tuned neural machine translation (NMT)-engines en RAG-augmented modellen behandelen elk verschillende contenttypes op hun eigen manier. In plaats van standaard op MT te kiezen, zorgt het kiezen van het juiste model voor elke taak voor superieure vertaalkwaliteit.
Belangrijke dimensies van de kwaliteit van machinevertaling
De kwaliteit van MT kan verwijzen naar verschillende factoren, afhankelijk van wie je het vraagt en wat er misging. Deze vier dimensies bestrijken het volledige plaatje, en elke van deze dimensies wordt het probleem dat het project definieert.
Nauwkeurigheid
Nauwkeurigheid meet of de vertaling de betekenis van de bron behoudt. Een vloeiende maar onnauwkeurige vertaling is moeilijker te vinden in review dan een logge maar nauwkeurige, wat deze fouten risicovoller maakt.
Vlotheid
Vloeiendheid is waar MT het vaakst zijn tekortkomingen laat zien. Grammatica en woordkeuze zijn tafelkwesties. Het moeilijkere probleem is register: een engine die correct vertaalt maar schrijft als een handleiding wanneer de inhoud om iets conversaties vraagt, of andersom.
Consistentie
Consistentie breekt stilletjes en op grote schaal. Dezelfde term die op drie verschillende manieren wordt weergegeven in een product-UI, een helpartikel en een marketingpagina, ondermijnt het vertrouwen van gebruikers en zorgt voor cumulatieve herwerking voor het team.
Contextbewustzijn
Contextbewustzijn is wat een engine die woorden vertaalt onderscheidt van een motor die betekenis vertaalt. Gegenderde voornaamwoorden in het Duits, een UI-label dat anders leest afhankelijk van het scherm, of een uitdrukking die idiomatisch is in de ene markt en in een andere onsamenhangend is, vereisen dat de engine interpreteert, niet alleen converteert.
Hoe Smartling consistentie versterkt
Woordenlijsthandhaving en hergebruik van vertaalgeheugen (TM) houden goedgekeurde terminologie en vooraf goedgekeurde formuleringen vastgelegd in elke opdracht. Zodra een term is goedgekeurd, past Smartling deze automatisch toe bij de volgende keer dat hij verschijnt, of de vertaling nu via MT, AI-vertaling of AI-menselijke vertaling (AIHT) gebeurt.
De AI-vertalingstoolkit van Smartling gaat nog een stap verder. Door de AI-functie voor het invoegen van termen in de woordenlijst, wordt ervoor gezorgd dat de vervangingen passen in de context van de tekst en grammatisch correct zijn, in plaats van de term simpelweg te vervangen.
Grammaticale waarborgen zijn cruciaal voor talen waar een woordenlijst verschillend moet buigen afhankelijk van de positie in een zin. AI-adaptief vertaalgeheugen vergroot de TM-positie in MT-workflows door beschikbare matches te optimaliseren, zodat vooraf goedgekeurde formuleringen worden meegenomen, zelfs wanneer de omliggende inhoud is veranderd.
Voor content waarbij consistentie meer betekent dan terminologie (nadruk op toon, register of merkstem) houdt de Smartling Transcreation Tool transcreatiegeheugen gescheiden van vertaalgeheugen. Daardoor vloeien creatieve aanpassingen niet door in standaard vertaalworkflows of introduceren ze inconsistentie waar letterlijke nauwkeurigheid vereist is.
Hoe de kwaliteit van de machinevertaling wordt gemeten
MT-kwaliteitsmeting combineert drie benaderingen. De meeste enterprise-programma's gebruiken alle drie op verschillende momenten in de workflow.
Menselijke evaluatie
Menselijke evaluatie is afhankelijk van getrainde taalkundigen die vertaalde inhoud beoordelen aan de hand van objectieve foutcategorieën. Het Multidimensional Quality Metrics (MQM) framework is de industriestandaard voor dit werk.
Beoordelaars loggen fouten op type, zoals nauwkeurigheid, vloeiendheid, terminologie, stijl en locatieconventies, en op ernst, zoals neutraal, minor, major of critical. Het systeem berekent een algemene kwaliteitsscore op basis van zwaartegewichten.
Linguistic Quality Assurance (LQA) stroomlijnt menselijke beoordeling tijdens MQM-evaluatie. LQA is gebaseerd op steekproeven, wat betekent dat teams een representatief deel van de vertaalde inhoud beoordelen om een proxy-meting van de algehele kwaliteit te maken, in plaats van elke string te inspecteren.
Geautomatiseerde metrics
Geautomatiseerde metrics zoals BLEU, COMET en TER vergelijken MT-output algoritmisch met referentietranslaties. Ze lopen in seconden, schalen over miljoenen strings en leveren consistente numerieke scores op.
Ze correpereren niet perfect met menselijk oordeel, daarom werken geautomatiseerde metrics het beste als vroege waarschuwingssignalen in plaats van als definitieve kwaliteitsbeoordelingen.
Hybride meting
Hybride meting combineert menselijke beoordeling van bemonsterde inhoud met geautomatiseerde scoring van het volledige corpus. Hybride benaderingen zijn het meest gebruikelijk in enterprise-productie, omdat ze de meetdiepte afwegen tegen de meetkosten.
Hoe Smartling hybride metingen mogelijk maakt
Smartling's LQA Suite verzorgt gestructureerde menselijke evaluatie. Taalkundigen evalueren vertalingen aan de hand van aanpasbare MQM-compatibele schema's. LQA kent een ernstniveau toe aan elke fout dat meewerkt in een algemene kwaliteitsscore.
Resultaten verschijnen in het LQA-dashboard per tijdsbestek, locatie, project of taak, waardoor lokalisatiemanagers een gestructureerd, datagedreven beeld krijgen van waar de kwaliteit staat en waar deze achteruitgaat.
Voor teams die MT op grote schaal draaien, is alleen sampling niet genoeg. De Language Quality Estimation (LQE) Agent evalueert automatisch elke MT-string en labelt elke Hoog, Medium of Lage op basis van de voorspelde nabewerkingsinspanning.
Hoge strings kunnen menselijke beoordeling volledig omzeilen in een dynamische workflow; Medium snaren worden gemarkeerd voor lichte bewerking. Review-inspanningen gaan waar het nodig is.
De twee tools dekken beide uiteinden van het meetprobleem: het volledige corpussignaal op elke MT-string, en gestructureerde menselijke scoring op bemonsterde inhoud. Beide voeden Smartling Analytics, waardoor teams de data krijgen om workflows te optimaliseren, beslissingen te rechtvaardigen en kwaliteitsprogramma's op termijn verantwoordelijk te houden.
Veelvoorkomende kwaliteitsproblemen met machinevertaling
Vijf faalmodi komen voor in enterprise MT-programma's. De meeste van die storingen zijn workflowproblemen, geen modelproblemen.
Letterlijke vertalingen. Uitdrukkingen, beeldspraak en cultureel specifieke formuleringen geven woord voor woord in plaats van op betekenis. Een "homerun" wordt een honkbalreferentie in een taal waar honkbal geen culturele betekenis heeft.
Terminologie-inconsistentie. Dezelfde merknaam verschijnt als drie verschillende vertalingen op dezelfde site. Een productnaam wordt op de ene pagina vertaald en op een andere in het Engels achtergelaten.
Grammaticale fouten. Geslachtsovereenkomst, werkwoordstijd en woordvolgorde komen verkeerd uit in talen met een rijkere morfologie dan de bron. Die fouten ontstaan wanneer MT-engines context missen over het onderwerp of object van een zin.
Contextfouten. Voornaamwoorden leiden tot het verkeerde antecedent. Homografen krijgen de verkeerde indruk. Een woord dat iets betekent in een juridisch document wordt vertaald alsof het iets anders betekent in een alledaagse zin.
Culturele mismatches. Formaliteiten, eerbewijzen en culturele verwijzingen missen het register dat het publiek verwacht.
Machinevertaling versus menselijke vertaalkwaliteit
Machinevertaling en menselijke vertaal zijn niet uitwisselbaar. Ze serveren verschillende content met verschillende afwegingen.
| Factor | Machine Translation | Menselijke vertaling |
|---|---|---|
| Snelheid | Hoog | Laag |
| Kosten | Laag | Hoog |
| Kwaliteit | Variabele | Hoog |
| Schaalbaarheid | Hoog | Gematigd |
Geen van beide benaderingen is universeel beter. De juiste vraag voor bedrijfsprogramma's is welke content op welk spoor hoort en hoe je het automatisch kunt routeren naarmate het volume groeit.
Smartling AutoSelect lost het routingprobleem op door content tijdens de vertaling te evalueren en deze naar de best geschikte MT-engine, LLM of menselijke workflowstap te sturen. Als de geselecteerde engine geen kwalitatieve vertaling kan leveren, probeert AutoSelect opnieuw met de volgende beste optie en valt indien nodig terug op een menselijke workflowstap.
Voor teams die nog meer controle willen, ondersteunt AutoSelect op maat gemaakte motoren in de rotatie naast standaard MT-aanbieders. Dat betekent dat domeinspecifieke content, zoals juridisch, medisch of zeer technisch, naar een daarvoor gebouwde engine kan worden gestuurd, terwijl algemene content het standaardpad volgt. Het resultaat is een routeringslaag die zich aanpast aan de complexiteit van de inhoud in plaats van één engine op alles toe te passen.
Hoe de kwaliteit van machinevertaling te verbeteren
De kwaliteit van MT verbetert via vijf tactieken, die elk een ander deel van de workflow aanpakken.
Gebruik glossaria. Goedgekeurde terminologie is consistent over strengs en taken heen. Zonder woordenlijst geeft dezelfde merkterm drie verschillende manieren weer binnen dezelfde inhoud.
Geef context. Metadata op segmentniveau, visuele context en omliggende inhoud verbeteren de nauwkeurigheid van de MT. Engines die strings in isolatie vertalen, missen de informatie die ze nodig hebben om ambiguïteit correct op te lossen.
Gebruik hybride workflows. Machine Translation Post-Editing (MTPE) combineert MT-output met menselijke review. MTPE gebruikt menselijke taalkundigen om de ruwe MT-output op te schonen. Voor die beoordelingsstap controleert Smartlings AI Post-Editing Agent automatisch grammatica, toon en semantische nauwkeurigheid — zodat de taalkundige corrigeert wat overblijft in plaats van helemaal opnieuw op te bouwen.
Standaardiseer processen. Teams die content door consistente workflows sturen met dezelfde woordenlijst, TM en reviewstappen, krijgen consistente kwaliteit. Teams die elk project anders behandelen, krijgen kwaliteit die de inconsistentie weerspiegelt.
Monitor de prestaties. LQA-monsters, LQE-scoring en rapportage van fouttrends laten zien waar de kwaliteit afneemt voordat het een klantgericht probleem wordt. Zonder monitoring ontstaan kwaliteitsproblemen pas als iemand ze extern heeft gemarkeerd.
Hoe Smartling de kwaliteit van MT in de praktijk verbetert
Smartlings AI Post-Editing Agent draait automatisch op MT-output voordat het een menselijke reviewer bereikt, controleert grammatica, toon en semantische nauwkeurigheid, en verrijkt vertalingen met je taalkundige assets zodat output dichter bij publiceerbaarheid aankomt.
De taalkundige corrigeert wat overblijft in plaats van helemaal opnieuw op te bouwen. In combinatie met de Language Quality Estimation (LQE) Agent, die elke MT-string Hoog, Medium of Laag labelt op basis van de voorspelde nabewerkingsinspanning.
Daardoor kunnen teams strings die aandacht nodig hebben direct routeren om strings met hoge betrouwbaarheid te beoordelen en te publiceren, zonder elke string hetzelfde te behandelen ongeacht het daadwerkelijke risico.
Hoe je kwaliteit op schaal kunt behouden
Het schalen van de MT-kwaliteit is een ander probleem dan het verbeteren van een enkele vertaling. Op schaal wordt kwaliteit een functie van hoe betrouwbaar de workflow kwaliteitscontroles toepast over duizenden of miljoenen strings. Vier principes bepalen of die betrouwbaarheid geldt.
Workflowstandaardisatie. Hetzelfde type content wordt elke keer door dezelfde workflow geleid. Marketingcontent verloopt via de marketingworkflow. Supportcontent verloopt door de supportworkflow. Kwaliteit stopt afhankelijk van wie een project bezit.
Automatisering Content verplaatst zich van bronsystemen naar vertaalworkflows zonder handmatige overdrachten. Goedkeuringen worden automatisch geleid. Vertaalde inhoud levert zonder export-import cycli terug naar het bronsysteem. Wanneer een string verandert, merkt de workflow dat, niet een projectmanager die een spreadsheet controleert.
Gecentraliseerde kwaliteitstracking. LQA-scores, LQE-verdelingen en fouttrends zijn op één plek aanwezig. Teams ontdekken inconsistenties tussen talen en inhoudstypen voordat ze zich opstapelen over honderden extra strings.
Voortdurende verbetering. Woordenlijsten, TM's en prompttemplates worden bijgewerkt naarmate er nieuwe termen en patronen ontstaan. De kwaliteitsbasis stijgt in de loop van de tijd in plaats van vlak te blijven of achteruit te gaan naarmate het contentvolume groeit.
Zonder dat alle vier bovenstaande principes samenwerken, wordt kwaliteit op schaal een gemiddeld probleem — goed genoeg in totaal, maar gebroken in de specifieke gevallen die het meest tellen.
Personio illustreert hoe die verandering er in de praktijk uitziet. Het HR-softwarebedrijf kopieerde handmatig broninhoud van Zendesk, stuurde bestanden per e-mail naar een vertaalbureau en plakte vertalingen terug. Dit proces werkte op laag volume, maar kon niet opschalen naar extra talen zonder het aantal mensen toe te voegen.
Na het centraliseren van hun lokalisatieprogramma op Smartling en de introductie van machinevertaling voor ondersteunende content, verwacht het contenteducatieteam van Personio 40% van hun huidige vertaalbudget te besparen en de interne beoordelingstijd met minstens de helft te verminderen. MT verzorgt de grootschalige, gestandaardiseerde hulpinhoud, terwijl Human Review regelt wat het daadwerkelijk nodig heeft. Personio investeert nu budget opnieuw in talen die het bedrijf zich voorheen niet kon veroorloven te ondersteunen.
Risico's van slechte kwaliteit van machinevertaling
Wanneer teams de MT-kwaliteit niet beheren, toont de impact zich op vier voorspelbare plekken.
Merkinconsistentie. Productnamen, slogans en kernmerktaal verschillen per markt. Klanten zien verschillende versies van hetzelfde merk, afhankelijk van de site waar ze terechtkomen.
Verwarring bij klanten. Productbeschrijvingen, ondersteuningsartikelen en afrekenprocessen leveren onduidelijke instructies op in de doeltalen. Klanten verlaten, misbruiken of escaleren.
Compliance-kwesties. Gereguleerde inhoud in juridische, medische en financiële categorieën brengt risico's met zich mee wanneer vertalingen de vereiste taal missen of onnauwkeurigheden introduceren. Sommige sectoren beschouwen vertaalfouten als overtredingen van de naleving.
Meer herwerking. Kwaliteitsproblemen komen na publicatie naar voren en vereisen handmatige schoonmaak. De kosten om content achteraf te repareren zijn hoger dan de kosten van het correct vertalen ervan de eerste keer.
Wat gebeurt er zonder kwaliteitssystemen?
Lokalisatieprogramma's die werken zonder gestructureerde kwaliteitssystemen volgen dezelfde vier patronen.
Inconsistente outputs. Terminologie, toon en formulering verschillen per content, omdat er geen gedeelde assets of regels zijn die ze stabiel houden.
Handmatige QA-vertragingen. Kwaliteit wordt afhankelijk van individuele beoordelaars die problemen één voor één ontdekken. QA wordt de bottleneck die de rest van de workflow eigenlijk zou moeten elimineren.
Gebrek aan zicht. Niemand beantwoordt basisvragen over kwaliteit, waaronder waar die sterk is, waar het afdrijft en welke talen of inhoudstypen het meeste risico met zich meebrengen.
Slechte schaalbaarheid. Het toevoegen van talen en contentvolume vermenigvuldigt de coördinatie-overhead in plaats van gebruik te maken van herbruikbare assets. Elke nieuwe locatie voelt net zo uitdagend als de eerste.
De kwaliteit van machinevertaling is een systeemprobleem
De kwaliteit van MT is van nature variabel. Enginekeuze, contenttype, taalpaar en workflowontwerp bepalen allemaal de output, en geen enkele tactiek levert op zichzelf consistente kwaliteit.
Succesvolle teams vertrouwen op een systeem, in plaats van MT op zichzelf. Binnen dat systeem passen gestructureerde workflows consistente kwaliteitscontroles toe voor elke functie. Automatisering verplaatst content door die workflows zonder handmatige overdrachten. En kwaliteitsmeting laat zien waar de output sterk is en waar deze afglijdt.
De meeste enterprise-teams hebben onderdelen van deze infrastructuur, en daar verbergen kwaliteitsproblemen. Smartling overbrugt de kloof door gestructureerde workflows, automatisering en kwaliteitsmeting te combineren binnen één platform, waardoor teams een herhaalbaar pad naar MT-kwaliteit krijgen dat schaalt met het contentvolume in plaats van het personeel.
Als je wilt zien hoe Smartling alles op één platform samenbrengt, boek dan een demo.
Veelgestelde vragen
De kwaliteit van de machinevertaling meet hoe nauwkeurig en natuurlijk vertaalde inhoud de betekenis en toon van de bron weerspiegelt. Evaluatie omvat nauwkeurigheid, vloeiendheid, consistentie en contextbewustzijn.
Kwaliteit varieert per taalpaar, inhoudstype en workflow, daarom meten en beheren enterprise-programma's MT-kwaliteit in plaats van het aan te nemen.
De drie gangbare benaderingen zijn menselijke evaluatie met behulp van het MQM-framework, geïmplementeerd via LQA; geautomatiseerde metrics zoals BLEU en COMET; en hybride meting die een bemonsterde menselijke review combineert met geautomatiseerde scoring van het volledige corpus.
Smartling's LQA Dashboard en Language Quality Estimation Agent (LQE) ondersteunen beide kanten van het hybride model.
Vijf factoren bepalen de kwaliteit van MT. Taalparcomplexiteit, inhoudstype, contextbeschikbaarheid, dekking van trainingsgegevens en modelselectie vormen allemaal de output.
Workflowontwerp is net zo belangrijk als elk van die factoren op zich, omdat kwaliteit op schaal afhangt van hoe betrouwbaar controles zoals glossaria en vertaalgeheugen worden toegepast.
MT presteert betrouwbaar voor content die aansluit bij de sterke punten van het model en loopt door een workflow die de juiste kwaliteitscontroles toepast. Inhoud met minder risico, handhaving van woordenlijst en geautomatiseerde kwaliteitscontroles wordt met veel vertrouwen geleverd.
Inhoud met hogere zichtbaarheid in marketing-, gereguleerde en merkkritische categorieën moet via hybride workflows zoals MTPE of AI post-editing gaan, waarbij LLM en menselijke validatie een laag kwaliteitsverificatie toevoegen.