Zurück zur Startseite

TranslationBench 1.0 · Ergebnisse für Ihre Redaktion

Den Inhalt bewahren. Im gesamten Manuskript.

ProsaBridge verbindet höhere Inhaltstreue mit flüssig lesbarer Sprache. Im Vergleich zweier Übersetzungen eines Fachbuchs mit 67.127 Wörtern erzielte ProsaBridge 59 % weniger gewichtete Fehlerpunkte als dasselbe KI-Modell bei direkter Nutzung. Der größte Vorteil: eine genauere Wiedergabe des Originals.

Buchvergleich
Dasselbe KI-Modell, mit ProsaBridge und direkt genutzt
Manuskriptumfang
67.127 Wörter · 61 Abschnitte
Bewertung
Unabhängige Blindbewertung nach einheitlichen Kriterien
Veröffentlichte Studien
Buch: DE → EN · Kurztexte: EN → DE

Der Qualitätsvorsprung von ProsaBridge

Weniger Fehlerpunkte im ganzen Buch
−59 %
Weniger gewichtete Fehlerpunkte als bei direkter Nutzung desselben KI-Modells – über das gesamte Buch hinweg, unabhängig und blind bewertet.
Weniger Fehlerpunkte beim Inhalt
−64 %
Fast zwei Drittel weniger gewichtete Fehlerpunkte für Sinnveränderungen, falsche Begriffe und Auslassungen – bei flüssig lesbarer Sprache.

Buchstudie · 16. September 2026

Ein ganzes Buch, dasselbe Modell, höhere Inhaltstreue

59 %

weniger gewichtete Fehlerpunkte mit ProsaBridge als bei direkter Nutzung desselben Modells. Bei inhaltlichen Fehlern sank der Wert um 64 %: mehr Inhaltstreue bei flüssig lesbarer Sprache.

Ein wissenschaftliches Buch, 67.127 Wörter, 61 Abschnitte: ProsaBridge überzeugte mit höherer Inhaltstreue über das gesamte Manuskript hinweg. Beide Übersetzungen entstanden mit GPT-6 Astra und wurden unabhängig anhand des deutschen Originals bewertet. Die Prüfer wussten nicht, welche Fassung mit ProsaBridge entstanden war.

Der Buchvergleich zeigt den Mehrwert von ProsaBridge über ein vollständiges Manuskript hinweg. Die Ergebnisse und die Bewertungsmethode können Sie unten im Detail einsehen.

Ihr Manuskript. Ihre Vorgaben. In einer neuen Sprache.

Steuern Sie Terminologie und Stil vor der Übersetzung und bearbeiten Sie das Ergebnis anschließend direkt in Word.

Sie geben die Richtung vor
Legen Sie Terminologie und Stil fest und klären Sie offene Fragen zum Ausgangstext, bevor die Übersetzung beginnt.
Das ganze Manuskript im Blick
Jeder Abschnitt wird mit Zusammenfassung, Glossar und Stilvorgaben übersetzt – für konsistente Begriffe und einen zusammenhängenden Text.
In Word weiterarbeiten
Sie erhalten Ihre Übersetzung als .docx-Datei mit der Struktur und Formatierung des Ausgangsdokuments – bereit für die Arbeit Ihrer Redaktion.

Sie behalten die Kontrolle – von Terminologie und Stil bis zur fertigen Übersetzung in Word.

Passenden Tarif finden
Methode und vollständige Ergebnisse

Die Buchstudie und der Kurztextvergleich sind getrennte Untersuchungen mit unterschiedlichen Texten, Sprachrichtungen und Modelleinstellungen. Hier finden Sie die Bewertungsmethode, alle veröffentlichten Ergebnisse und die Datensätze zum Herunterladen.

Buchstudie: Werte beider Prüfer

Buchstudie · 16. September 2026 · Ein Buch · 61 Abschnitte · 67.127 Wörter · Deutsch → Englisch · Blindbewertung · Text nicht öffentlich

Die Buchwerte geben gewichtete Fehlerpunkte pro 100 Wörter des Ausgangstexts an. Dafür werden Fehlerpunkte und Wortzahlen über alle Abschnitte und beide Prüfer zusammengefasst. Leichte Fehler zählen 1 Punkt, schwere 5 und kritische 10. Die Kategorie „Genauigkeit“ erfasst Sinnveränderungen, falsche Begriffe und Auslassungen; „Lesbarkeit“ erfasst sprachliche Mängel. Die Werte geben gewichtete Fehlerpunkte an, nicht die Anzahl falscher Wörter oder die Zahl der erforderlichen Korrekturen.

FassungFehlerwertWertGenauigkeitLesbarkeitFable 5.1 mediumGPT-6 Astra medium
GPT-6 Astra innerhalb von ProsaBridge0,080,060,020,120,04
GPT-6 Astra direkt genutzt0,200,180,020,280,12

GenauigkeitLesbarkeit

So lesen Sie die Ergebnisse des Kurztextvergleichs

Der Vergleich umfasst 23 Einträge: KI-Modelle mit ProsaBridge oder bei direkter Nutzung sowie drei Übersetzungsdienste.

Mit ProsaBridge
Das KI-Modell arbeitete innerhalb von ProsaBridge. Es las zuerst den ganzen Text, erstellte einen Übersetzungsplan und übersetzte anhand dieses Plans.
Modell allein
Dasselbe KI-Modell erhielt den Text einmal und übersetzte ihn in einem einzigen Schritt.
Übersetzungsdienst
DeepL, Google Translate oder Amazon Translate, jeweils mit ihrem Dienst für ganze Dokumente.
Fehlerwert
Jeder Prüfer ordnet die gefundenen Fehler den Kategorien von MQM (Multidimensional Quality Metrics) zu. Ein leichter Fehler zählt 1 Punkt, ein schwerer 5 und ein kritischer 10 Punkte. Der Fehlerwert gibt die gewichteten Fehlerpunkte pro 100 Wörter an, gemittelt über beide Prüfer und alle zwölf Texte. Niedrigere Werte bedeuten weniger gewichtete Fehlerpunkte.
Ein schwerer inhaltlicher Fehler zählt so viel wie fünf leichte Fehler. Der Wert berücksichtigt also, wie schwer die Fehler wiegen. Er gibt weder die Zahl der Fehler noch den Anteil falscher Wörter an; auch die Zahl der nötigen Korrekturen lässt sich daraus nicht ablesen.
Genauigkeit
Die Übersetzung weicht inhaltlich vom Original ab: verfälschte Fakten, unzutreffende Fachbegriffe oder ausgelassene Sätze.
Lesbarkeit
Die Übersetzung gibt den Inhalt zwar wieder, ist aber sprachlich mangelhaft: holprige Formulierungen, Grammatikfehler oder unpassender Tonfall.

Alle Ergebnisse des Kurztextvergleichs

Alle 23 veröffentlichten Einträge aus dem Vergleich von zwölf Texten, übersetzt vom Englischen ins Deutsche. Die Tabelle enthält die Modelleinstellungen, die Einzelwerte der Prüfer und die relativen Rechenkosten. Die Ergebnisse beziehen sich auf die in dieser Studie getesteten Konfigurationen. Die Rechenkosten geben die Kosten der Modellnutzung als Vielfaches der niedrigsten gemessenen Kosten an. Dokumentbearbeitung und Lektorat sind nicht enthalten; es handelt sich nicht um die Preise von ProsaBridge.

Spalte anklicken zum Sortieren · sortiert nach Wert

RangFassung
1GPT-6 AstraMit ProsaBridge · high/xhigh/xhigh0,140,060,080,270,02501,9×
2GPT-5.6 SolMit ProsaBridge · high/xhigh/xhigh0,250,070,180,340,16158,9×
3GPT-6 AstraModell allein · xhigh0,250,140,110,310,20184,2×
4GPT-6 AstraMit ProsaBridge · medium/medium/medium0,250,090,160,420,09109,5×
5GPT-5.6 SolModell allein · xhigh0,400,200,210,470,3484,9×
6GPT-6 AstraModell allein · medium0,440,120,320,610,2721,4×
7Fable 5.1Modell allein · xhigh0,450,180,270,330,5896,6×
8Fable 5.1Mit ProsaBridge · high/xhigh/xhigh0,480,230,250,290,67354,4×
9Gemini 3.8 FlashMit ProsaBridge · high/xhigh/xhigh0,510,190,320,540,4747,5×
10GPT-5.6 LunaMit ProsaBridge · medium/xhigh/xhigh0,660,310,350,770,5610,9×
11Opus 5Mit ProsaBridge · high/xhigh/xhigh0,700,290,410,480,92174,6×
12Fable 5.1Modell allein · medium0,810,280,530,770,8545,1×
13Gemini 3.8 FlashModell allein · xhigh0,820,410,410,780,8517,6×
14Fable 5.1Mit ProsaBridge · medium/medium/medium0,830,410,420,641,02169,1×
15GPT-5.6 LunaModell allein · xhigh1,000,530,470,921,084,2×
16Grok 4.6Mit ProsaBridge · high/xhigh/xhigh1,330,420,910,991,67101×
17GLM-5.3 FlashMit ProsaBridge · xhigh/xhigh/xhigh1,460,600,851,591,329,5×
18GLM-5.3 FlashModell allein · xhigh1,650,660,991,571,73
19Opus 5Modell allein · xhigh1,831,070,761,681,9917,6×
20Grok 4.6Modell allein · xhigh2,571,011,572,512,6415,2×
21DeepLÜbersetzungsdienst2,881,900,982,603,16
22GoogleÜbersetzungsdienst7,135,981,156,307,96
23AmazonÜbersetzungsdienst15,9312,603,3314,4217,44

Bei dieser Fassung wurde dasselbe KI-Modell verwendet wie bei einem der Prüfer. Der veröffentlichte Wert stützt sich auf beide Prüfer.

So wird der Fehlerwert im Kurztextvergleich berechnet

Zwei KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra, bewerteten jede Übersetzung anhand ihres Originals. Sie wussten nicht, wie die jeweilige Übersetzung entstanden war, und sahen die Bewertungen des anderen Prüfers nicht. Jeder Prüfer erfasste Fehler mit einer Kategorie, einem Schweregrad und einer Begründung. Die Kategorien folgen MQM (Multidimensional Quality Metrics), einem Rahmen zur Bewertung von Übersetzungsqualität.

Ein leichter Fehler zählt 1 Punkt, ein schwerer Fehler 5 Punkte, ein kritischer Fehler 10 Punkte. Die gewichteten Fehlerpunkte einer Übersetzung werden addiert, durch ihre Wortzahl geteilt und auf 100 Wörter umgerechnet. Der Wert einer Fassung für einen Text ist der Mittelwert der beiden Prüfer; ihr veröffentlichter Wert ist der Mittelwert über die zwölf Texte.

Im Kurztextvergleich las jedes Modell mit ProsaBridge zunächst den Text, erstellte einen Übersetzungsplan und übersetzte anhand dieses Plans. Bei der direkten Nutzung erhielt das Modell den Text und das gewünschte Ausgabeformat. Die veröffentlichten Daten nennen für jede Fassung das Modell und seine Einstellungen. Die Ergebnisse gelten für die jeweils getesteten Einstellungen.

So haben wir die Rangfolge geprüft

Die zusätzlichen Vergleiche bestätigten weite Teile der Rangfolge: Die drei Übersetzungsdienste blieben am Ende. Auch die Reihenfolge von der letzten KI-Fassung bis zu Amazon Translate wurde bestätigt. Insgesamt behielten 10 von 22 benachbarten Paaren ihre veröffentlichte Reihenfolge. Die vorderen Fassungen liegen dicht beieinander; lesen Sie die ersten Plätze deshalb als Gruppe.

Nach dem Festlegen der Rangliste haben beide Prüfer jede Fassung mit der direkt darunter platzierten verglichen, Text für Text, ohne zu wissen, wie die jeweilige Übersetzung entstanden war. Ein Text zählt nur dann für eine der beiden Fassungen, wenn beide Prüfer übereinstimmen.

  1. 1GPT-6 Astra, Mit ProsaBridgevs.2GPT-5.6 Sol, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  2. 2GPT-5.6 Sol, Mit ProsaBridgevs.3GPT-6 Astra, Modell allein
    2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  3. 3GPT-6 Astra, Modell alleinvs.4GPT-6 Astra, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer keinen Unterschied sahen, 8 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  4. 4GPT-6 Astra, Mit ProsaBridgevs.5GPT-5.6 Sol, Modell allein
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  5. 5GPT-5.6 Sol, Modell alleinvs.6GPT-6 Astra, Modell allein
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  6. 6GPT-6 Astra, Modell alleinvs.7Fable 5.1, Modell allein
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 8 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  7. 7Fable 5.1, Modell alleinvs.8Fable 5.1, Mit ProsaBridge
    3 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Prüfer bevorzugten die niedriger platzierte Fassung
  8. 8Fable 5.1, Mit ProsaBridgevs.9Gemini 3.8 Flash, Mit ProsaBridge
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  9. 9Gemini 3.8 Flash, Mit ProsaBridgevs.10GPT-5.6 Luna, Mit ProsaBridge
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 9 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  10. 10GPT-5.6 Luna, Mit ProsaBridgevs.11Opus 5, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 10 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  11. 11Opus 5, Mit ProsaBridgevs.12Fable 5.1, Modell allein
    6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 4 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  12. 12Fable 5.1, Modell alleinvs.13Gemini 3.8 Flash, Modell allein
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Prüfer bevorzugten die niedriger platzierte Fassung
  13. 13Gemini 3.8 Flash, Modell alleinvs.14Fable 5.1, Mit ProsaBridge
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  14. 14Fable 5.1, Mit ProsaBridgevs.15GPT-5.6 Luna, Modell allein
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  15. 15GPT-5.6 Luna, Modell alleinvs.16Grok 4.6, Mit ProsaBridge
    9 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  16. 16Grok 4.6, Mit ProsaBridgevs.17GLM-5.3 Flash, Mit ProsaBridge
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  17. 17GLM-5.3 Flash, Mit ProsaBridgevs.18GLM-5.3 Flash, Modell allein
    6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  18. 18GLM-5.3 Flash, Modell alleinvs.19Opus 5, Modell allein
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 5 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Ausgeglichen
  19. 19Opus 5, Modell alleinvs.20Grok 4.6, Modell allein
    8 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  20. 20Grok 4.6, Modell alleinvs.21DeepL, Übersetzungsdienst
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  21. 21DeepL, Übersetzungsdienstvs.22Google, Übersetzungsdienst
    11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  22. 22Google, Übersetzungsdienstvs.23Amazon, Übersetzungsdienst
    11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  • Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten
  • Texte, bei denen beide Prüfer keinen Unterschied sahen
  • Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten
  • Texte, bei denen die Prüfer uneinig waren

Grok 4.6 allein und DeepL liegen zu dicht beieinander, um sie zu trennen. Bei Unterschieden von wenigen Hundertstelpunkten kann sich die Reihenfolge in einem weiteren Durchgang ändern. Der Datensatz enthält alle Paarvergleiche.

Aussagekraft und Grenzen der Studien

Wir haben ein wissenschaftliches Buch zweimal mit GPT-6 Astra vom Deutschen ins Englische übersetzt: einmal mit ProsaBridge und einmal direkt mit dem Modell. Die Reasoning-Einstellung für die Übersetzung war beide Male „sehr hoch“. Bei der direkten Übersetzung erhielt das Modell das gesamte Buch mit der Anweisung, dass sich die Übersetzung wie ein englischsprachiges Original lesen sollte. Anschließend bewerteten beide unabhängigen Prüfer jeden Abschnitt anhand des deutschen Ausgangstexts. Sie wussten nicht, wie die Übersetzungen entstanden waren, und hatten keinen Zugriff auf das Glossar oder die Vorbereitungsunterlagen von ProsaBridge.

  • Die Buchstudie bewertete die Übersetzungsqualität; den Zeitaufwand für das Lektorat und mögliche finanzielle Einsparungen untersuchte sie nicht. Vor der Veröffentlichung ist weiterhin eine redaktionelle Prüfung erforderlich.
  • Die Buchstudie vergleicht zwei vollständige Übersetzungsabläufe anhand eines Buchs, mit einer Übersetzung pro Ablauf und unabhängiger Blindbewertung. Das direkt genutzte Modell erhielt das Glossar von ProsaBridge nicht. Der Beitrag einzelner Schritte lässt sich aus diesem Vergleich nicht bestimmen. Die Ergebnisse gelten für die damals getesteten Einstellungen und garantieren keine gleich große Verbesserung bei anderen Manuskripten. Modelle und Einstellungen können sich mit der Weiterentwicklung von ProsaBridge ändern. Das Kundenbuch bleibt vertraulich; die Werte und Abschnittszahlen stehen zum Herunterladen bereit.
  • Im Kurztextvergleich wurde vom Englischen ins Deutsche übersetzt, in der Buchstudie vom Deutschen ins Englische. Andere Sprachpaare wurden nicht untersucht.
  • Die beiden Studien verwenden unterschiedliche Texte, Sprachrichtungen und Berechnungen des Gesamtwerts. Ihre Werte lassen sich deshalb nur innerhalb der jeweiligen Studie vergleichen. Wie sich die Dokumentlänge auf den Vorteil von ProsaBridge auswirkt, lässt sich daraus nicht ablesen.
  • Jede Studie wurde einmal durchgeführt; die Werte wurden nicht über mehrere Durchgänge gemittelt. Unterschiede von wenigen Hundertstelpunkten können auf Zufallsschwankungen beruhen.
  • Die Prüfer sind KI-Modelle, und zwei der teilnehmenden Modelle sind zugleich die Prüfer. Ihre getrennten Werte sind sichtbar, damit Sie das selbst prüfen können. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.

Was wir nicht veröffentlichen

  • Die zwölf Texte. Sie wurden für diesen Benchmark geschrieben und nie veröffentlicht. Bei einer Veröffentlichung könnten künftige Modelle ihnen im Training begegnen, was spätere Vergleiche weniger aussagekräftig machen würde. Titel, Textsorte, Länge und Schwierigkeit stehen weiter unten.
  • Die Anweisungen, die ProsaBridge den Modellen gibt, und die Anweisungen, denen die Prüfer folgen.
  • Was die Durchgänge gekostet haben. Die Ergebnistabelle zeigt nur Vielfache der günstigsten Konfiguration.
  • Die Notizen der Prüfer und die Übersetzungen selbst, weil sie die Texte offenlegen würden.

Die zwölf Texte

Sieben Kurzgeschichten und fünf Sachtexte mit jeweils besonderen übersetzerischen Herausforderungen.

TextArtWörterÜbersetzerische Herausforderungen
1The LeaseErzählung, Dialog431Wechsel von Sie zu du, Dialog, trockener Humor
2GravelErzählung, Innensicht485Gedanken in erlebter Rede, umgangssprachliche Einschübe, unmarkierte Fragen
3The Orchard LedgerErzählung, lyrisch463Eine lange Metapher, die von Anfang bis Ende tragen muss
4SouthpawErzählung, Szene449Kurze, harte Sätze neben einem einzigen langen
5The CommitteeErzählung, Satire446Lange Schachtelsätze, Einschübe, Ironie, die von der Wortstellung abhängt
6Moving the NeedleErzählung, Arbeitswelt462Viele Redewendungen und ein Wortspiel, von dem der ganze Text abhängt
7The VisitorErzählung, Innensicht458Ein absichtlich unklares „sie“, das unklar bleiben muss
8Remarks at the Dedication of the Cedar Run Flood MemorialSachtext, Rede441Ton einer amerikanischen Gedenkrede, Wiederholungen als Stilmittel, Namen von Institutionen
9Allision of the Ferry Marguerite Bay at Harbor Point TerminalSachtext, Unfallbericht478Nautische Begriffe, Passiv, exakte Zeiten und Maße
10The Sleep of SwiftsSachtext, Populärwissenschaft493Poetische Wissenschaftssprache im Wechsel zwischen Daten und bildhaften Beschreibungen
11Expanding District Heating in Mid-Sized CitiesSachtext, Politikpapier436„Sollte“, „muss“ und „kann“, die ihre genaue Stärke behalten müssen; falsche Freunde; gleichbleibende Begriffe
12Midterm Evaluation of the Aldercreek Adult Literacy ProgramSachtext, Evaluationsbericht437Begriffspaare, die getrennt bleiben müssen, vorsichtige Zuschreibungen, abgewogene Empfehlungen

Vor der Veröffentlichung entfernte Modelle

Diese Modelle haben während der Entwicklung teilgenommen und fehlen in den veröffentlichten Ergebnissen. Die Gründe für jeden Ausschluss sind mit Belegen dokumentiert.

Claude Sonnet 5
Nach sieben Texten wegen schwacher Übersetzungsqualität entfernt: 3,18 und 3,22 Fehlerpunkte pro 100 Wörter, hinter jedem anderen KI-Modell zu dieser Zeit.
Kimi K2 Thinking
Entfernt, weil es bei drei der sieben Texte das Ausgabelimit des Anbieters erreichte, ohne eine Antwort zu liefern.
Mistral Large 3
Entfernt, weil es eigene Dokumentformatierung hinzufügte und übersetzten Text zurückgab, wo der Ablauf feste Referenzcodes verlangt.
Gemini 3.1 Pro und GPT-5.6 Terra
Vor dem veröffentlichten Durchgang zurückgezogen: Für ihren Preis waren ihre Werte zu schwach. Günstigere Modelle erreichten bessere Werte, und bessere Modelle kosteten etwa dasselbe. Ihre früheren Ergebnisse sind archiviert.

Daten herunterladen

Der Datensatz zum Kurztextvergleich enthält die Bewertungen jeder Fassung durch beide Prüfer, Fehlerzahlen nach Schweregrad und Kategorie, relative Rechenkosten und Vergleiche benachbarter Fassungen in der Rangliste.

Datensatz 1.0 herunterladen

Der Datensatz zur Buchstudie enthält die Gesamtwerte beider Übersetzungen, die Werte nach Fehlerart und Prüfer sowie Angaben zum Umfang des Buchs. Der Buchtext bleibt vertraulich.

Datensatz zum Buch herunterladen
Durchgang
translationbench-run-fa35fa02-3190-4f82-b379-8d05b7dde5d7
Version
1.0 (7.2)
Abgeschlossen
12. September 2026