Thomson Reuters hat mit Thomson erstmals ein eigenes Large Language Model intern entwickelt. Das KI-Spitzenmodell basiert auf einer Open-Source-Grundlage, wurde jedoch mit proprietären Inhalten und Fachwissen spezialisiert. Der Anbieter verspricht sich davon neben hoher Leistungsfähigkeit vor allem mehr Kontrolle und KI-Souveränität. Zum Einsatz kommt Thomson zunächst in CoCounsel Legal.
Thomson Reuters erweitert seine KI-Strategie um ein eigenes Large Language Model (LLM). Das intern entwickelte Modell namens Thomson soll bei professionellen Aufgaben mit führenden Frontier Models konkurrieren können, dabei aber mit deutlich geringerem finanziellem Aufwand auskommen. Nach Angaben des Unternehmens flossen 40 Millionen US-Dollar in Personal und Rechenleistung für die Entwicklung und das Training.
Statt ein Basismodell vollständig neu aufzubauen, setzt Thomson Reuters auf eine Open-Source-Grundlage. Diese wurde mit Mid-Training- und Post-Training-Verfahren auf die Anforderungen professioneller Anwender spezialisiert. Eine wesentliche Rolle spielen dabei die über Jahrzehnte aufgebauten Inhalte von Westlaw, Practical Law, Checkpoint und Reuters. Hunderte Fachexpertinnen und Fachexperten waren laut Unternehmen von der Definition der Trainingsziele bis zur abschließenden Evaluation beteiligt.
„Seit Jahren betrachtet die KI-Branche Skalierung als die Antwort: größere Modelle, mehr Rechenleistung, mehr Geld. Thomson zeigt, dass es einen anderen Weg gibt“, sagte Joel Hron, Chief Technology Officer von Thomson Reuters. „Man beginnt mit einer starken Grundlage, spezialisiert sie tiefgehend auf die Arbeit, auf die es ankommt, und kann so eine Intelligenz entwickeln, die hochleistungsfähig, deutlich effizienter und vollständig unter eigener Kontrolle ist. Wir glauben, dass das die wirtschaftlichen Rahmenbedingungen professioneller KI verändert.“
Proprietäre Inhalte als Grundlage der Spezialisierung
Bislang hat Thomson Reuters weniger als zehn Prozent seiner Inhalte für das Training des Modells verwendet. Die weitere Entwicklung soll jedoch nicht allein darin bestehen, die Datenmenge zu erhöhen. Im Mittelpunkt steht vielmehr eine stärkere Spezialisierung auf professionelle Aufgaben.
„Thomson zeigt, was möglich ist, wenn man KI auf jahrzehntelang aufgebauten proprietären Inhalten und redaktioneller Expertise entwickelt“, sagte Steve Hasker, CEO von Thomson Reuters. „Das ist ein Vorteil, über den nur Thomson Reuters verfügt, und das zeigt sich in den Ergebnissen: Unsere ersten Evaluationen sehen Thomson bei einer Reihe von Aufgaben auf Augenhöhe mit den neuesten Frontier Models. Wir setzen das Modell in CoCounsel Legal ein; weitere Funktionen und Optionen für souveräne KI werden folgen. Das ist der Maßstab, den wir weiter anheben wollen.“
Nach Angaben von Thomson Reuters erzielt das Modell gegenüber seinem zugrunde liegenden Foundation Model insbesondere beim Befolgen komplexer Anweisungen sowie bei der Verarbeitung umfangreicher domänenspezifischer Inhalte Leistungssteigerungen. Thomson kann außerdem gemeinsam mit proprietären Werkzeugen wie Westlaw und Practical Law trainiert werden.
KI-Souveränität rückt in den Mittelpunkt
Mit einem eigenen Modell will Thomson Reuters zugleich mehr Kontrolle über zentrale Fragen beim Einsatz generativer KI erhalten. Dazu zählen Training und Verhalten des Modells, dessen Betriebsumgebung sowie der Umgang mit vertraulichen Informationen.
Das Unternehmen sieht darin einen Vorteil gegenüber der ausschließlichen Nutzung externer General-Purpose-Modelle. Die bisherigen Ergebnisse sollen nach Angaben von Thomson Reuters darauf hindeuten, dass proprietäres Training in Verbindung mit menschlicher Fachexpertise Verbesserungen ermöglicht, die nicht allein durch den Zugriff eines allgemeinen Modells auf entsprechende Inhalte erreicht werden.
Ein weiterer Schwerpunkt liegt auf der externen Überprüfung. Bereits vor dem Launch wurde Thomson Wissenschaftlerinnen und Wissenschaftlern aus den Bereichen Recht und KI für Evaluationen zur Verfügung gestellt. Weitere externe Prüfungen sollen folgen. Zusätzlich stellt Thomson Reuters eine kleinere Variante als Open-Weight-Modell über Hugging Face für akademische und nicht-kommerzielle Zwecke bereit.
„Ich habe Thomson anhand einiger der anspruchsvolleren Fragen, die Studierende in meinem Kurs zum Unternehmenssteuerrecht gestellt haben, mit ChatGPT und Claude verglichen. Alle drei Modelle beantworteten die Fragen korrekt, aber insgesamt gefielen mir die Antworten von Thomson am besten. Besonders geschätzt habe ich die Links zu Fachabhandlungen, durch die die Antworten transparenter und für die juristische Arbeit nützlicher wurden.“ – Jonathan H. Choi, Washington University School of Law
Auch Tests zum kanadischen Arbeitsrecht gehörten zur externen Evaluation:
„Unsere Evaluation ergab, dass die Qualität der Quellenangaben von Thomson im Allgemeinen mit führenden Frontier Models mithalten kann, selbst bei Tests mit Fragen zum kanadischen Arbeitsrecht ohne eine speziell auf Kanada zugeschnittene Einstellung.“ – Professor Samuel Dahan, Director, Queen’s Conflict Analytics Lab and Cornell Legal AI Lab
Kontrolle und Verifikation als Entwicklungsziel
Thomson Reuters positioniert das Modell insbesondere für Einsatzfelder, in denen Genauigkeit, Nachvollziehbarkeit und der Umgang mit sensiblen Daten eine zentrale Rolle spielen. Dies ordnet das Unternehmen in sein Konzept der sogenannten Fiduciary-Grade AI ein. Kundendaten werden der Mitteilung zufolge ohne ausdrückliche Zustimmung nicht für das Training des Modells verwendet.
Mit dem eigenen LLM kontrolliert Thomson Reuters zudem das Modell selbst und damit einen weiteren Teil seiner KI-Infrastruktur. Nach Angaben des Unternehmens soll Thomson zu einem Bruchteil der Kosten vergleichbarer Frontier Models trainiert worden sein und sich auch entsprechend kostengünstiger betreiben lassen.
Erster Einsatz in CoCounsel Legal
Seinen ersten praktischen Einsatz erhält Thomson in Tabular Analysis innerhalb von CoCounsel Legal. Die Funktion ist für umfangreiche und strukturierte Dokumentenprüfungen vorgesehen. CoCounsel bleibt dabei ein Multi-Model-System: Thomson wird für Aufgaben eingesetzt, bei denen das proprietäre Modell nach Einschätzung des Anbieters besondere Vorteile bietet, während für andere Aufgaben weiterhin andere Modelle genutzt werden.
Mit der kommenden Version von Tabular Analysis soll Thomson für Anwaltskanzleien und Rechtsabteilungen verfügbar werden. Anschließend plant Thomson Reuters, die eigenen Modelle auf weitere Bereiche seines Legal- und Tax-Portfolios auszuweiten. Auch zusätzliche Angebote rund um souveräne KI sind angekündigt.
Damit ergänzt Thomson Reuters seine bestehenden Inhalte, Technologien und Fachkompetenzen um ein selbst kontrolliertes Sprachmodell. Ob die Kombination aus Open-Source-Basis, proprietären Datenbeständen und fachlicher Spezialisierung tatsächlich dauerhaft mit größeren Frontier Models konkurrieren kann, sollen die weiteren internen und externen Evaluationen zeigen.
Weitere Informationen zu Thomson Reuters finden Sie hier.
