TranslationBench 1.0 · Ergebnisse für Ihre Redaktion
Den Inhalt bewahren. Im gesamten Manuskript.
ProsaBridge verbindet höhere Inhaltstreue mit flüssig lesbarer Sprache. Im Vergleich zweier Übersetzungen eines Fachbuchs mit 67.127 Wörtern erzielte ProsaBridge 59 % weniger gewichtete Fehlerpunkte als dasselbe KI-Modell bei direkter Nutzung. Der größte Vorteil: eine genauere Wiedergabe des Originals.
- Buchvergleich
- Dasselbe KI-Modell, mit ProsaBridge und direkt genutzt
- Manuskriptumfang
- 67.127 Wörter · 61 Abschnitte
- Bewertung
- Unabhängige Blindbewertung nach einheitlichen Kriterien
- Veröffentlichte Studien
- Buch: DE → EN · Kurztexte: EN → DE
Der Qualitätsvorsprung von ProsaBridge
- Weniger Fehlerpunkte im ganzen Buch
- −59 %
- Weniger gewichtete Fehlerpunkte als bei direkter Nutzung desselben KI-Modells – über das gesamte Buch hinweg, unabhängig und blind bewertet.
- Weniger Fehlerpunkte beim Inhalt
- −64 %
- Fast zwei Drittel weniger gewichtete Fehlerpunkte für Sinnveränderungen, falsche Begriffe und Auslassungen – bei flüssig lesbarer Sprache.
Buchstudie · 16. September 2026
Ein ganzes Buch, dasselbe Modell, höhere Inhaltstreue
−59 %
weniger gewichtete Fehlerpunkte mit ProsaBridge als bei direkter Nutzung desselben Modells. Bei inhaltlichen Fehlern sank der Wert um 64 %: mehr Inhaltstreue bei flüssig lesbarer Sprache.
Ein wissenschaftliches Buch, 67.127 Wörter, 61 Abschnitte: ProsaBridge überzeugte mit höherer Inhaltstreue über das gesamte Manuskript hinweg. Beide Übersetzungen entstanden mit GPT-6 Astra und wurden unabhängig anhand des deutschen Originals bewertet. Die Prüfer wussten nicht, welche Fassung mit ProsaBridge entstanden war.
Der Buchvergleich zeigt den Mehrwert von ProsaBridge über ein vollständiges Manuskript hinweg. Die Ergebnisse und die Bewertungsmethode können Sie unten im Detail einsehen.
Ihr Manuskript. Ihre Vorgaben. In einer neuen Sprache.
Steuern Sie Terminologie und Stil vor der Übersetzung und bearbeiten Sie das Ergebnis anschließend direkt in Word.
- Sie geben die Richtung vor
- Legen Sie Terminologie und Stil fest und klären Sie offene Fragen zum Ausgangstext, bevor die Übersetzung beginnt.
- Das ganze Manuskript im Blick
- Jeder Abschnitt wird mit Zusammenfassung, Glossar und Stilvorgaben übersetzt – für konsistente Begriffe und einen zusammenhängenden Text.
- In Word weiterarbeiten
- Sie erhalten Ihre Übersetzung als .docx-Datei mit der Struktur und Formatierung des Ausgangsdokuments – bereit für die Arbeit Ihrer Redaktion.
Sie behalten die Kontrolle – von Terminologie und Stil bis zur fertigen Übersetzung in Word.
Passenden Tarif findenMethode und vollständige Ergebnisse
Die Buchstudie und der Kurztextvergleich sind getrennte Untersuchungen mit unterschiedlichen Texten, Sprachrichtungen und Modelleinstellungen. Hier finden Sie die Bewertungsmethode, alle veröffentlichten Ergebnisse und die Datensätze zum Herunterladen.
Buchstudie: Werte beider Prüfer
Buchstudie · 16. September 2026 · Ein Buch · 61 Abschnitte · 67.127 Wörter · Deutsch → Englisch · Blindbewertung · Text nicht öffentlich
Die Buchwerte geben gewichtete Fehlerpunkte pro 100 Wörter des Ausgangstexts an. Dafür werden Fehlerpunkte und Wortzahlen über alle Abschnitte und beide Prüfer zusammengefasst. Leichte Fehler zählen 1 Punkt, schwere 5 und kritische 10. Die Kategorie „Genauigkeit“ erfasst Sinnveränderungen, falsche Begriffe und Auslassungen; „Lesbarkeit“ erfasst sprachliche Mängel. Die Werte geben gewichtete Fehlerpunkte an, nicht die Anzahl falscher Wörter oder die Zahl der erforderlichen Korrekturen.
| Fassung | Fehlerwert | Wert | Genauigkeit | Lesbarkeit | Fable 5.1 medium | GPT-6 Astra medium |
|---|---|---|---|---|---|---|
| GPT-6 Astra innerhalb von ProsaBridge | 0,08 | 0,06 | 0,02 | 0,12 | 0,04 | |
| GPT-6 Astra direkt genutzt | 0,20 | 0,18 | 0,02 | 0,28 | 0,12 | |
GenauigkeitLesbarkeit
So lesen Sie die Ergebnisse des Kurztextvergleichs
Der Vergleich umfasst 23 Einträge: KI-Modelle mit ProsaBridge oder bei direkter Nutzung sowie drei Übersetzungsdienste.
- Mit ProsaBridge
- Das KI-Modell arbeitete innerhalb von ProsaBridge. Es las zuerst den ganzen Text, erstellte einen Übersetzungsplan und übersetzte anhand dieses Plans.
- Modell allein
- Dasselbe KI-Modell erhielt den Text einmal und übersetzte ihn in einem einzigen Schritt.
- Übersetzungsdienst
- DeepL, Google Translate oder Amazon Translate, jeweils mit ihrem Dienst für ganze Dokumente.
- Fehlerwert
- Jeder Prüfer ordnet die gefundenen Fehler den Kategorien von MQM (Multidimensional Quality Metrics) zu. Ein leichter Fehler zählt 1 Punkt, ein schwerer 5 und ein kritischer 10 Punkte. Der Fehlerwert gibt die gewichteten Fehlerpunkte pro 100 Wörter an, gemittelt über beide Prüfer und alle zwölf Texte. Niedrigere Werte bedeuten weniger gewichtete Fehlerpunkte.
- Ein schwerer inhaltlicher Fehler zählt so viel wie fünf leichte Fehler. Der Wert berücksichtigt also, wie schwer die Fehler wiegen. Er gibt weder die Zahl der Fehler noch den Anteil falscher Wörter an; auch die Zahl der nötigen Korrekturen lässt sich daraus nicht ablesen.
- Genauigkeit
- Die Übersetzung weicht inhaltlich vom Original ab: verfälschte Fakten, unzutreffende Fachbegriffe oder ausgelassene Sätze.
- Lesbarkeit
- Die Übersetzung gibt den Inhalt zwar wieder, ist aber sprachlich mangelhaft: holprige Formulierungen, Grammatikfehler oder unpassender Tonfall.
Alle Ergebnisse des Kurztextvergleichs
Alle 23 veröffentlichten Einträge aus dem Vergleich von zwölf Texten, übersetzt vom Englischen ins Deutsche. Die Tabelle enthält die Modelleinstellungen, die Einzelwerte der Prüfer und die relativen Rechenkosten. Die Ergebnisse beziehen sich auf die in dieser Studie getesteten Konfigurationen. Die Rechenkosten geben die Kosten der Modellnutzung als Vielfaches der niedrigsten gemessenen Kosten an. Dokumentbearbeitung und Lektorat sind nicht enthalten; es handelt sich nicht um die Preise von ProsaBridge.
Spalte anklicken zum Sortieren · sortiert nach Wert
| Rang | Fassung | ||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra†Mit ProsaBridge · high/xhigh/xhigh | 0,14 | 0,06 | 0,08 | 0,27 | 0,02 | 501,9× |
| 2 | GPT-5.6 SolMit ProsaBridge · high/xhigh/xhigh | 0,25 | 0,07 | 0,18 | 0,34 | 0,16 | 158,9× |
| 3 | GPT-6 Astra†Modell allein · xhigh | 0,25 | 0,14 | 0,11 | 0,31 | 0,20 | 184,2× |
| 4 | GPT-6 Astra†Mit ProsaBridge · medium/medium/medium | 0,25 | 0,09 | 0,16 | 0,42 | 0,09 | 109,5× |
| 5 | GPT-5.6 SolModell allein · xhigh | 0,40 | 0,20 | 0,21 | 0,47 | 0,34 | 84,9× |
| 6 | GPT-6 Astra†Modell allein · medium | 0,44 | 0,12 | 0,32 | 0,61 | 0,27 | 21,4× |
| 7 | Fable 5.1†Modell allein · xhigh | 0,45 | 0,18 | 0,27 | 0,33 | 0,58 | 96,6× |
| 8 | Fable 5.1†Mit ProsaBridge · high/xhigh/xhigh | 0,48 | 0,23 | 0,25 | 0,29 | 0,67 | 354,4× |
| 9 | Gemini 3.8 FlashMit ProsaBridge · high/xhigh/xhigh | 0,51 | 0,19 | 0,32 | 0,54 | 0,47 | 47,5× |
| 10 | GPT-5.6 LunaMit ProsaBridge · medium/xhigh/xhigh | 0,66 | 0,31 | 0,35 | 0,77 | 0,56 | 10,9× |
| 11 | Opus 5Mit ProsaBridge · high/xhigh/xhigh | 0,70 | 0,29 | 0,41 | 0,48 | 0,92 | 174,6× |
| 12 | Fable 5.1†Modell allein · medium | 0,81 | 0,28 | 0,53 | 0,77 | 0,85 | 45,1× |
| 13 | Gemini 3.8 FlashModell allein · xhigh | 0,82 | 0,41 | 0,41 | 0,78 | 0,85 | 17,6× |
| 14 | Fable 5.1†Mit ProsaBridge · medium/medium/medium | 0,83 | 0,41 | 0,42 | 0,64 | 1,02 | 169,1× |
| 15 | GPT-5.6 LunaModell allein · xhigh | 1,00 | 0,53 | 0,47 | 0,92 | 1,08 | 4,2× |
| 16 | Grok 4.6Mit ProsaBridge · high/xhigh/xhigh | 1,33 | 0,42 | 0,91 | 0,99 | 1,67 | 101× |
| 17 | GLM-5.3 FlashMit ProsaBridge · xhigh/xhigh/xhigh | 1,46 | 0,60 | 0,85 | 1,59 | 1,32 | 9,5× |
| 18 | GLM-5.3 FlashModell allein · xhigh | 1,65 | 0,66 | 0,99 | 1,57 | 1,73 | 1× |
| 19 | Opus 5Modell allein · xhigh | 1,83 | 1,07 | 0,76 | 1,68 | 1,99 | 17,6× |
| 20 | Grok 4.6Modell allein · xhigh | 2,57 | 1,01 | 1,57 | 2,51 | 2,64 | 15,2× |
| 21 | DeepLÜbersetzungsdienst | 2,88 | 1,90 | 0,98 | 2,60 | 3,16 | – |
| 22 | GoogleÜbersetzungsdienst | 7,13 | 5,98 | 1,15 | 6,30 | 7,96 | – |
| 23 | AmazonÜbersetzungsdienst | 15,93 | 12,60 | 3,33 | 14,42 | 17,44 | – |
† Bei dieser Fassung wurde dasselbe KI-Modell verwendet wie bei einem der Prüfer. Der veröffentlichte Wert stützt sich auf beide Prüfer.
So wird der Fehlerwert im Kurztextvergleich berechnet
Zwei KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra, bewerteten jede Übersetzung anhand ihres Originals. Sie wussten nicht, wie die jeweilige Übersetzung entstanden war, und sahen die Bewertungen des anderen Prüfers nicht. Jeder Prüfer erfasste Fehler mit einer Kategorie, einem Schweregrad und einer Begründung. Die Kategorien folgen MQM (Multidimensional Quality Metrics), einem Rahmen zur Bewertung von Übersetzungsqualität.
Ein leichter Fehler zählt 1 Punkt, ein schwerer Fehler 5 Punkte, ein kritischer Fehler 10 Punkte. Die gewichteten Fehlerpunkte einer Übersetzung werden addiert, durch ihre Wortzahl geteilt und auf 100 Wörter umgerechnet. Der Wert einer Fassung für einen Text ist der Mittelwert der beiden Prüfer; ihr veröffentlichter Wert ist der Mittelwert über die zwölf Texte.
Im Kurztextvergleich las jedes Modell mit ProsaBridge zunächst den Text, erstellte einen Übersetzungsplan und übersetzte anhand dieses Plans. Bei der direkten Nutzung erhielt das Modell den Text und das gewünschte Ausgabeformat. Die veröffentlichten Daten nennen für jede Fassung das Modell und seine Einstellungen. Die Ergebnisse gelten für die jeweils getesteten Einstellungen.
›So haben wir die Rangfolge geprüft
Die zusätzlichen Vergleiche bestätigten weite Teile der Rangfolge: Die drei Übersetzungsdienste blieben am Ende. Auch die Reihenfolge von der letzten KI-Fassung bis zu Amazon Translate wurde bestätigt. Insgesamt behielten 10 von 22 benachbarten Paaren ihre veröffentlichte Reihenfolge. Die vorderen Fassungen liegen dicht beieinander; lesen Sie die ersten Plätze deshalb als Gruppe.
Nach dem Festlegen der Rangliste haben beide Prüfer jede Fassung mit der direkt darunter platzierten verglichen, Text für Text, ohne zu wissen, wie die jeweilige Übersetzung entstanden war. Ein Text zählt nur dann für eine der beiden Fassungen, wenn beide Prüfer übereinstimmen.
- 1GPT-6 Astra, Mit ProsaBridgevs.2GPT-5.6 Sol, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 2GPT-5.6 Sol, Mit ProsaBridgevs.3GPT-6 Astra, Modell allein2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 3GPT-6 Astra, Modell alleinvs.4GPT-6 Astra, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer keinen Unterschied sahen, 8 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 4GPT-6 Astra, Mit ProsaBridgevs.5GPT-5.6 Sol, Modell allein5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 5GPT-5.6 Sol, Modell alleinvs.6GPT-6 Astra, Modell allein2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 6GPT-6 Astra, Modell alleinvs.7Fable 5.1, Modell allein4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 8 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 7Fable 5.1, Modell alleinvs.8Fable 5.1, Mit ProsaBridge3 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenPrüfer bevorzugten die niedriger platzierte Fassung
- 8Fable 5.1, Mit ProsaBridgevs.9Gemini 3.8 Flash, Mit ProsaBridge2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 9Gemini 3.8 Flash, Mit ProsaBridgevs.10GPT-5.6 Luna, Mit ProsaBridge2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 9 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 10GPT-5.6 Luna, Mit ProsaBridgevs.11Opus 5, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 10 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 11Opus 5, Mit ProsaBridgevs.12Fable 5.1, Modell allein6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 4 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 12Fable 5.1, Modell alleinvs.13Gemini 3.8 Flash, Modell allein1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenPrüfer bevorzugten die niedriger platzierte Fassung
- 13Gemini 3.8 Flash, Modell alleinvs.14Fable 5.1, Mit ProsaBridge5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 14Fable 5.1, Mit ProsaBridgevs.15GPT-5.6 Luna, Modell allein4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 15GPT-5.6 Luna, Modell alleinvs.16Grok 4.6, Mit ProsaBridge9 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 16Grok 4.6, Mit ProsaBridgevs.17GLM-5.3 Flash, Mit ProsaBridge4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 17GLM-5.3 Flash, Mit ProsaBridgevs.18GLM-5.3 Flash, Modell allein6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 18GLM-5.3 Flash, Modell alleinvs.19Opus 5, Modell allein5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 5 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenAusgeglichen
- 19Opus 5, Modell alleinvs.20Grok 4.6, Modell allein8 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 20Grok 4.6, Modell alleinvs.21DeepL, Übersetzungsdienst5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 21DeepL, Übersetzungsdienstvs.22Google, Übersetzungsdienst11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 22Google, Übersetzungsdienstvs.23Amazon, Übersetzungsdienst11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten
- Texte, bei denen beide Prüfer keinen Unterschied sahen
- Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten
- Texte, bei denen die Prüfer uneinig waren
Grok 4.6 allein und DeepL liegen zu dicht beieinander, um sie zu trennen. Bei Unterschieden von wenigen Hundertstelpunkten kann sich die Reihenfolge in einem weiteren Durchgang ändern. Der Datensatz enthält alle Paarvergleiche.
Aussagekraft und Grenzen der Studien
Wir haben ein wissenschaftliches Buch zweimal mit GPT-6 Astra vom Deutschen ins Englische übersetzt: einmal mit ProsaBridge und einmal direkt mit dem Modell. Die Reasoning-Einstellung für die Übersetzung war beide Male „sehr hoch“. Bei der direkten Übersetzung erhielt das Modell das gesamte Buch mit der Anweisung, dass sich die Übersetzung wie ein englischsprachiges Original lesen sollte. Anschließend bewerteten beide unabhängigen Prüfer jeden Abschnitt anhand des deutschen Ausgangstexts. Sie wussten nicht, wie die Übersetzungen entstanden waren, und hatten keinen Zugriff auf das Glossar oder die Vorbereitungsunterlagen von ProsaBridge.
- Die Buchstudie bewertete die Übersetzungsqualität; den Zeitaufwand für das Lektorat und mögliche finanzielle Einsparungen untersuchte sie nicht. Vor der Veröffentlichung ist weiterhin eine redaktionelle Prüfung erforderlich.
- Die Buchstudie vergleicht zwei vollständige Übersetzungsabläufe anhand eines Buchs, mit einer Übersetzung pro Ablauf und unabhängiger Blindbewertung. Das direkt genutzte Modell erhielt das Glossar von ProsaBridge nicht. Der Beitrag einzelner Schritte lässt sich aus diesem Vergleich nicht bestimmen. Die Ergebnisse gelten für die damals getesteten Einstellungen und garantieren keine gleich große Verbesserung bei anderen Manuskripten. Modelle und Einstellungen können sich mit der Weiterentwicklung von ProsaBridge ändern. Das Kundenbuch bleibt vertraulich; die Werte und Abschnittszahlen stehen zum Herunterladen bereit.
- Im Kurztextvergleich wurde vom Englischen ins Deutsche übersetzt, in der Buchstudie vom Deutschen ins Englische. Andere Sprachpaare wurden nicht untersucht.
- Die beiden Studien verwenden unterschiedliche Texte, Sprachrichtungen und Berechnungen des Gesamtwerts. Ihre Werte lassen sich deshalb nur innerhalb der jeweiligen Studie vergleichen. Wie sich die Dokumentlänge auf den Vorteil von ProsaBridge auswirkt, lässt sich daraus nicht ablesen.
- Jede Studie wurde einmal durchgeführt; die Werte wurden nicht über mehrere Durchgänge gemittelt. Unterschiede von wenigen Hundertstelpunkten können auf Zufallsschwankungen beruhen.
- Die Prüfer sind KI-Modelle, und zwei der teilnehmenden Modelle sind zugleich die Prüfer. Ihre getrennten Werte sind sichtbar, damit Sie das selbst prüfen können. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.
Was wir nicht veröffentlichen
- Die zwölf Texte. Sie wurden für diesen Benchmark geschrieben und nie veröffentlicht. Bei einer Veröffentlichung könnten künftige Modelle ihnen im Training begegnen, was spätere Vergleiche weniger aussagekräftig machen würde. Titel, Textsorte, Länge und Schwierigkeit stehen weiter unten.
- Die Anweisungen, die ProsaBridge den Modellen gibt, und die Anweisungen, denen die Prüfer folgen.
- Was die Durchgänge gekostet haben. Die Ergebnistabelle zeigt nur Vielfache der günstigsten Konfiguration.
- Die Notizen der Prüfer und die Übersetzungen selbst, weil sie die Texte offenlegen würden.
Die zwölf Texte
Sieben Kurzgeschichten und fünf Sachtexte mit jeweils besonderen übersetzerischen Herausforderungen.
| Text | Art | Wörter | Übersetzerische Herausforderungen | |
|---|---|---|---|---|
| 1 | The Lease | Erzählung, Dialog | 431 | Wechsel von Sie zu du, Dialog, trockener Humor |
| 2 | Gravel | Erzählung, Innensicht | 485 | Gedanken in erlebter Rede, umgangssprachliche Einschübe, unmarkierte Fragen |
| 3 | The Orchard Ledger | Erzählung, lyrisch | 463 | Eine lange Metapher, die von Anfang bis Ende tragen muss |
| 4 | Southpaw | Erzählung, Szene | 449 | Kurze, harte Sätze neben einem einzigen langen |
| 5 | The Committee | Erzählung, Satire | 446 | Lange Schachtelsätze, Einschübe, Ironie, die von der Wortstellung abhängt |
| 6 | Moving the Needle | Erzählung, Arbeitswelt | 462 | Viele Redewendungen und ein Wortspiel, von dem der ganze Text abhängt |
| 7 | The Visitor | Erzählung, Innensicht | 458 | Ein absichtlich unklares „sie“, das unklar bleiben muss |
| 8 | Remarks at the Dedication of the Cedar Run Flood Memorial | Sachtext, Rede | 441 | Ton einer amerikanischen Gedenkrede, Wiederholungen als Stilmittel, Namen von Institutionen |
| 9 | Allision of the Ferry Marguerite Bay at Harbor Point Terminal | Sachtext, Unfallbericht | 478 | Nautische Begriffe, Passiv, exakte Zeiten und Maße |
| 10 | The Sleep of Swifts | Sachtext, Populärwissenschaft | 493 | Poetische Wissenschaftssprache im Wechsel zwischen Daten und bildhaften Beschreibungen |
| 11 | Expanding District Heating in Mid-Sized Cities | Sachtext, Politikpapier | 436 | „Sollte“, „muss“ und „kann“, die ihre genaue Stärke behalten müssen; falsche Freunde; gleichbleibende Begriffe |
| 12 | Midterm Evaluation of the Aldercreek Adult Literacy Program | Sachtext, Evaluationsbericht | 437 | Begriffspaare, die getrennt bleiben müssen, vorsichtige Zuschreibungen, abgewogene Empfehlungen |
Vor der Veröffentlichung entfernte Modelle
Diese Modelle haben während der Entwicklung teilgenommen und fehlen in den veröffentlichten Ergebnissen. Die Gründe für jeden Ausschluss sind mit Belegen dokumentiert.
- Claude Sonnet 5
- Nach sieben Texten wegen schwacher Übersetzungsqualität entfernt: 3,18 und 3,22 Fehlerpunkte pro 100 Wörter, hinter jedem anderen KI-Modell zu dieser Zeit.
- Kimi K2 Thinking
- Entfernt, weil es bei drei der sieben Texte das Ausgabelimit des Anbieters erreichte, ohne eine Antwort zu liefern.
- Mistral Large 3
- Entfernt, weil es eigene Dokumentformatierung hinzufügte und übersetzten Text zurückgab, wo der Ablauf feste Referenzcodes verlangt.
- Gemini 3.1 Pro und GPT-5.6 Terra
- Vor dem veröffentlichten Durchgang zurückgezogen: Für ihren Preis waren ihre Werte zu schwach. Günstigere Modelle erreichten bessere Werte, und bessere Modelle kosteten etwa dasselbe. Ihre früheren Ergebnisse sind archiviert.
Daten herunterladen
Der Datensatz zum Kurztextvergleich enthält die Bewertungen jeder Fassung durch beide Prüfer, Fehlerzahlen nach Schweregrad und Kategorie, relative Rechenkosten und Vergleiche benachbarter Fassungen in der Rangliste.
Datensatz 1.0 herunterladenDer Datensatz zur Buchstudie enthält die Gesamtwerte beider Übersetzungen, die Werte nach Fehlerart und Prüfer sowie Angaben zum Umfang des Buchs. Der Buchtext bleibt vertraulich.
Datensatz zum Buch herunterladen- Durchgang
- translationbench-run-fa35fa02-3190-4f82-b379-8d05b7dde5d7
- Version
- 1.0 (7.2)
- Abgeschlossen
- 12. September 2026