Comment comparez-vous la qualité des traductions entre GPT, Claude et DeepL ?

Réponse rapide

Évaluer la qualité de la traduction entre des moteurs comme GPT-4o, Claude 3.5 Sonnet et DeepL nécessite trois composantes : un ensemble de tests représentatif tiré de vos types de contenu et paires de langages réels, un notation automatisée standardisée utilisant des métriques telles que BLEU, MetricX ou COMET, et un cadre d’évaluation cohérent appliqué de manière identique sur tous les moteurs. Aucun moteur ne l’emporte sur toutes les paires de langages et types de contenu. L’objectif pratique du benchmarking est d’identifier quel moteur fonctionne le mieux à grande échelle pour votre contenu spécifique, puis de router automatiquement les tâches de production vers ce moteur. Le hub IA de Smartling évalue en continu les performances du moteur et aligne chaque chaîne vers le moteur le plus performant selon sa paire de langage et son type de contenu.

Pourquoi l’étalonnage des moteurs de traduction n’est pas simple

Les performances des moteurs de traduction varient considérablement selon la paire de langues, le type de contenu et le domaine. Un moteur qui produit un texte marketing espagnol solide peut sous-performer sur la documentation technique japonaise. Un benchmark construit uniquement sur des ensembles de tests publics peut ne pas refléter le contenu réel de votre organisation, ce qui signifie que le gagnant d’une évaluation standardisée peut ne pas être le gagnant en production.

Les trois erreurs les plus courantes dans le benchmarking par traduction sont l’utilisation d’un ensemble de tests trop petit, l’application de critères d’évaluation différents à différents moteurs, et le traitement d’une exécution de benchmark comme une décision unique plutôt qu’une mesure continue. La qualité de la traduction des LLM change à chaque mise à jour du modèle, ce qui signifie qu’un moteur qui était troisième il y a six mois pourrait désormais surpasser l’ancien leader.

 

Quelles sont les méthodes de notation automatisées qui mesurent réellement

 
BLEU (Étudiant en évaluation bilingue)

Les scores BLEU mesurent le chevauchement entre une sortie traduite automatiquement et une traduction de référence humaine, exprimée par une valeur comprise entre 0 et 1. BLEU est rapide et largement utilisé comme référence, mais il récompense les correspondances de mots superficielles plutôt que la précision sémantique, ce qui signifie qu’une hallucination fluide peut obtenir un bon score tandis qu’une traduction correcte mais formulée différemment est faible. Pour le benchmarking en entreprise, BLEU est utile comme filtre au premier passage mais insuffisant comme signal de qualité autonome.

 
MetricX et COMET

MetricX (Google) et COMET (Unbabel) sont des métriques d'évaluation neuronales qui utilisent des modèles de langage pour évaluer la qualité de la traduction en comparant le texte source, la sortie machine et les traductions de référence selon des dimensions sémantiques. Les deux sont plus fortement corrélés au jugement humain que le BLEU, notamment pour la détection des erreurs de fluidité et des changements de sens. Pour les programmes d'entrepriseévaluant la traduction LLM à grande échelle, MetricX et COMET fournissent un signal plus fiable que BLEU seul.

 
Évaluation humaine comme couche de validation

Les indicateurs automatisés mesurent la qualité de la traduction par rapport à une référence. Des évaluateurs humains déterminent si une traduction est efficace dans son contexte, respecte le ton de la marque et est fluide pour un locuteur natif. Pour les contenus à forts enjeux, l'analyse comparative automatisée réduit le nombre de candidats et l'évaluation humaine valide le candidat gagnant avant qu'une décision concernant le routage de la production ne soit prise.

 

Comment exécuter un benchmark de traduction qui produit des résultats exploitables

  • Construis un ensemble de tests représentatif. Sélectionnez entre 200 et 500 chaînes de sources issues de votre contenu de production réel, couvrant les paires de langues, les types de contenu et les domaines qui vous tiennent le plus à cœur. Un benchmark basé sur des données de test publiques génériques ne prédira pas comment un moteur se comporte sur vos textes marketing, articles du centre d’aide ou chaînes d’interface utilisateur produit.
  • Faites passer des cordes identiques dans chaque moteur. Soumettez les mêmes chaînes sources à GPT-4o, Claude 3.5 Sonnet, DeepL et tout autre moteur en cours d’évaluation sans différences de prétraitement entre eux. Les conditions contrôlées sont le seul moyen d’isoler la performance du moteur des autres variables.
  • Obtenez des scores avec MetricX ou COMET comme indicateurs principaux. Appliquez un notation identique à toutes les sorties. Suivez les scores par paire de langues et type de contenu plutôt que de faire la moyenne sur tous les résultats, car les scores agrégés peuvent masquer une variation significative par langue.
  • Appliquez votre mémoire de traduction et votre glossaire avant de comparer. La qualité de la traduction en entreprise dépend en partie de la capacité d’intégration d’un moteur avec vos ressources linguistiques existantes. Faites des tests de référence dans des conditions incluant votre glossaire et votre TM plutôt que d’évaluer la production brute du moteur isolément.
  • Planifiez des mesures continues. Les capacités de traduction de LLM évoluent à chaque nouvelle version du modèle. Un test de performance est un instantané à un moment précis. Les équipes qui répartissent les tâches en fonction de données de performance continues plutôt que d'une seule décision de référence maintiennent une meilleure qualité au fil du temps.

Quand la traduction est la bonne priorité

Des programmes d’entreprise évaluant quel moteur LLM ou MT utiliser par défaut pour la traduction en production et nécessitant des données objectives et reproductibles pour soutenir la décision.
Les équipes qui ont remarqué des variations de qualité entre les paires de langues et qui souhaitent comprendre si le routage de différentes paires vers différents moteurs améliorerait la qualité globale de la sortie.
Des organisations qui intègrent un nouveau moteur et doivent valider ses performances par rapport à leur base de production existante avant de changer.
Des programmes qui souhaitent réduire le temps de montage humain en identifiant quel moteur produit la meilleure sortie en premier passage pour leurs types de contenu spécifiques.

Quand un référentiel formel peut ne pas être nécessaire

⚠️

Des programmes précoces dans l’adoption de la traduction IA où l’établissement de workflows de base, des glossaires et de la MT est la priorité immédiate et la sélection du moteur peut être différée jusqu’à ce que le volume justifie l’investissement en benchmarking.

⚠️

Les équipes utilisant une plateforme avec un routage moteur intégré qui évalue et route automatiquement, où le benchmarking est géré par la plateforme plutôt que manuellement par l’équipe de localisation.

Comment Smartling gère-t-elle le benchmarking moteur et le routage ?

Le hub d'IA de Smartling évalue la qualité de la traduction à travers plus de 20 modèles de langage et moteurs de traduction automatique, dont GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Vertex et autres. L'équipe d'IA de Smartling effectue régulièrement des tests de performance à l'aide de MetricX, COMET et BLEU afin d'évaluer les performances du moteur sur différents types de contenu et paires de langues. Les résultats alimentent le système de routage Auto Select de Smartling, qui attribue chaque chaîne au moteur le plus performant pour sa paire de langues et son type de contenu spécifiques, plutôt que d'appliquer un seul moteur de manière universelle.

Pour les équipes d’entreprise souhaitant effectuer leurs propres comparaisons, la plateforme Smartling prend en charge des profils LLM configurables qui permettent aux équipes de tester différentes configurations de moteurs sur du contenu de production avant de définir une règle de routage par défaut.

 

Document d’aide : Smartling Auto Select MT

Document d’aide : Smartling Auto Select LLM

Qualité de traduction des benchmarks à travers GPT, Claude et DeepL

Le hub IA de Smartling évalue la qualité de la traduction à travers plus de 20 LLM et moteurs de MT et redirige chaque chaîne vers le moteur le plus performant selon sa paire de langues et son type de contenu. Voyez comment les équipes d’entreprise utilisent Auto Select pour éliminer les incertitudes dans la sélection du moteur.