Plattform
Lösungen
TruvaLI AI
Ressourcen
Unternehmen
Ressourcen
TruvaLI AI

TruvaLI Technischer Bericht

Dieser Bericht beschreibt, wie TruvaLI aufgebaut ist: das Quellenarchiv, wie Trainingsbeispiele generiert und gefiltert werden, wie das Modell trainiert und bereitgestellt wird, wie Version 1.1 im Vergleich zu seinem Basismodell abschneidet, wo es Schwachstellen aufweist und die Roadmap bis Juni 2027.

Version 1.1 · Oktober 2026 · Bitrelic Teknoloji A.Ş.

Abstract

Allgemeine Sprachmodelle sind in den Bereichen der Compliance-Arbeit, auf die es am meisten ankommt, schwach: Sie erfinden Artikelnummern und Fristen, kennen die türkische Gesetzgebung nicht im Detail und laufen auf Servern, an die ein Institut keine Kundendaten übermitteln darf. Wir beschreiben TruvaLI, ein Vision-Language-Modell, das auf der Grundlage eines Archivs von rund 6.000 Quellen für AML, Betrugsprävention und Compliance angepasst wurde. Wir haben ein Open-Source-Basismodell mittels LoRA auf synthetischen Beispielen feinabgestimmt, die von selbstgehosteten Open-Source-Teacher-Modellen generiert und durch domänenspezifische Quality Gates gefiltert wurden. Im Vergleich zu seinem Basismodell steigert v1.1 die Genauigkeit bei Compliance-Prüfungen von 88,8 % auf 92,6 %, die fundierte Beantwortung von Fragen (Grounded Question Answering) von 89,3 % auf 91,6 % und die Erzeugung valider strukturierter Ausgaben von 0 % auf 89,3 %. Wir berichten über diese Ergebnisse sowie über die Schwachstellen des Modells und legen die Roadmap bis Juni 2027 dar.

1. Einleitung

Der Alltag eines Compliance-Beauftragten besteht aus Lesen: Vorschriften, Typologieberichte, Fallakten, Stellungnahmen, Adverse Media. Große Sprachmodelle lesen schnell, aber drei Probleme halten sie von der praktischen Arbeit fern. Sie antworten selbstbewusst, wenn sie etwas nicht wissen – was in einem Bereich, in dem eine falsche Frist einen regulatorischen Verstoß bedeutet, inakzeptabel ist. Ihr Wissen über die türkische Regulierung (MASAK, BDDK, TCMB, SPK, KVKK) ist lückenhaft. Und die meisten von ihnen laufen ausschließlich auf den Servern eines Drittanbieters, wohin keine Kundendaten fließen dürfen.

TruvaLI wurde entwickelt, um drei Fragen zu beantworten:

  1. Kann ein offenes Modell, das mit Domänendaten angepasst wurde, sein Basismodell bei Compliance-Aufgaben übertreffen und gleichzeitig ehrlich bleiben, wenn es etwas nicht weiß?
  2. Können die Trainingsdaten ohne die Nutzung von Ausgaben geschlossener kommerzieller Modelle und ohne echte Kundendaten generiert werden?
  3. Kann das Ergebnis auf einem einzigen Server betrieben werden, den das Institut oder wir kontrollieren?

2. Designprinzipien

  • Grounded (Fundiert): Eine Antwort zu einer Vorschrift zitiert die genaue Textstelle, aus der sie stammt, oder weist darauf hin, dass die Textstelle nicht existiert.
  • Maskiert: Personenbezogene Daten erscheinen nur als MASKED:-Token; Beispiele, die unmaskierte Daten enthalten, werden verworfen.
  • Saubere Herkunft (Clean Lineage): Synthetische Daten stammen von Open-Source-Teacher-Modellen auf unserer eigenen Hardware; geschlossene kommerzielle Modelle werden nur für das Design und die Evaluierung genutzt.
  • Jurisdiktionsbewusst: Eine ausländische Regelung wird als ausländisch benannt und niemals als türkisches Recht dargestellt.
  • Vier-Augen-Prinzip: Alles, was geschrieben wird (eine Entscheidung, eine Regel, ein Bericht), geht zur menschlichen Freigabe.
  • Self-hosted: Die Generierung der Trainingsdaten und die Bereitstellung des Modells laufen auf von uns kontrollierter Hardware.

3. Daten

3.1 Quellenarchiv

Das Archiv umfasst rund 6.000 Quellen und 270.000 Seiten, aufgeteilt in einzeln zitierbare Abschnitte.

TypAnteil der Quellen
Leitfäden und Aufsichtsberichte61%
Wissenschaftliche Artikel17%
Abschlussarbeiten7%
Gesetze5%
Verordnungen4%
Bücher3%
Rundschreiben und Mitteilungen2%

Die größten Herausgeber sind KVKK, MASAK, FATF, FFIEC, FinCEN, FINTRAC, die EBA, die Egmont Group, TBMM, der EDPB, das ICO, GİB und BDDK. Über die Türkei hinaus deckt das Archiv Großbritannien, die USA, die EU, Deutschland, Kanada, Montenegro, Kroatien, Aserbaidschan, Nordzypern, die Schweiz, die VAE, Hongkong, Australien, den Westbalkan und Zentralasien ab. Türkische und englische Quellen machen den größten Teil aus; montenegrinische, kroatische, deutsche und aserbaidschanische Quellen sind der am schnellsten wachsende Teil.

3.2 Domänenabdeckung

DomäneTypische Quellen
AML/Compliance-ProgrammeMASAK-Leitfäden, FATF-Empfehlungen, Wolfsberg, technische Standards der AMLA
Betrug (Fraud)BKM, TBB, TÖDEB, Publikationen der Cybercrime-Polizei, Urteile des Kassationshofs
DatenschutzKVKK-Ausschussbeschlüsse, EDPB-Leitlinien
Transaktionsüberwachung und AnalytikWolfsberg, MAS, HKMA und FCA Überwachungsleitfäden, Kalibrierungsforschung
Steuern und gefälschte DokumenteVDK- und GİB-Leitfäden, Urteile zu Scheinrechnungen
Wirtschaftliches Eigentum, PEPs und KorruptionHandelsregistervorschriften, FATF und nationale Leitfäden
Krypto-Assets, VASPs und die Travel RuleSPK-Sekundärregulierung, technische Standards der MiCA, FATF-Updates
Meldung verdächtiger Transaktionen und FIUsMASAK-Meldehandbücher, FIU-Jahresberichte, Egmont
Terrorismusfinanzierung und SanktionenOFAC, EU- und UN-Sanktionslisten-Leitfäden, Regeln zum Einfrieren von Vermögenswerten
Zahlungsverkehr und E-GeldTCMB, EBA, PSD3
Illegales GlücksspielGerichtsentscheidungen, MASAK-Publikationen, akademische Arbeiten
Verhaltenswissenschaft und OpferpsychologieAkademische Abschlussarbeiten und Artikel, Verhaltensanalyse-Forschung
Finanzagenten (Money Mules), Menschenhandel und organisierte KriminalitätEuropol, OSZE, UK Finance, Cifas, nationale Warnungen
KriminalitätsstatistikTÜİK, UNODC, Eurostat, Europol, nationale Polizei- und Zahlungsorgane

3.3 Lizenzierung

Jede Quelle ist entweder als zitierfähig (Gesetze, Publikationen öffentlicher Stellen, offen lizenziertes Material) oder als Read-to-Learn gekennzeichnet. Zitierfähige Abschnitte können in einer Antwort mit einer Referenz erscheinen. Read-to-Learn-Material wird nur den Teacher-Modellen gezeigt, niemals TruvaLI im Wortlaut. Jedes generierte Beispiel wird überprüft, um sicherzustellen, dass es nicht mehr als 15 aufeinanderfolgende Wörter oder 15 % seiner 8-Wort-Sequenzen aus einer Quelle kopiert. Quellen, deren Nutzungsbedingungen das KI-Training untersagen, sind ausgeschlossen. Read-to-Learn-Material wird niemals übersetzt; nur der zitierfähige Kern wird übersetzt, da eine Übersetzung ein abgeleitetes Werk darstellt.

3.4 Generierung synthetischer Daten

Trainingsbeispiele werden von Open-Source-Teacher-Modellen geschrieben, die auf unseren eigenen GPUs laufen.

  • Rejection Sampling: Der Teacher schreibt vier bis acht Kandidaten pro Aufgabe; der beste fließt in das Training ein, der schlechteste valide Kandidat wird zur abgelehnten Hälfte eines Präferenzpaars.
  • Hard Distractors: Fundierte Fragen werden zusammen mit ähnlichen, aber falschen Textstellen gestellt, damit das Modell lernt, die richtige auszuwählen.
  • Unbeantwortbare Fragen: Ein Viertel der fundierten Fragen hat keine Antwort in den vorgegebenen Abschnitten; die korrekte Reaktion ist, dies so zu benennen.
  • Verhaltenssimulator: 18 Kunden-Archetypen, von denen etwa 30 % legitim sind, erzeugen gelabelte Verhaltensszenarien, damit das Modell nicht lernt, dass jeder ungewöhnliche Kunde ein Krimineller ist.
  • Fallkarten (Case Cards): Reale Fälle aus den Nachrichten und Gerichtsentscheidungen werden in anonymisierte Fallkarten umgewandelt, und jede Karte wird für die Produkte und Regulierungsbehörden verschiedener Sektoren umgeschrieben.

3.5 Quality Gates

Jedes Beispiel muss einen automatischen Validator durchlaufen, bevor es für das Training zugelassen wird:

  • Schema- und Tool-Call-Prüfungen: Struktur, übereinstimmende Tool-Call-Identifikatoren, valide JSON-Argumente
  • Muster für personenbezogene Daten: Türkische Identifikationsnummern, IBANs, E-Mail-Adressen und Telefonnummern
  • Eine Liste mit Begriffen zur Vermeidung von Tipping-off für alle an Kunden gerichteten Texte
  • Regelsatz-Vokabular: Die 168 Felder und 53 Aggregate der TruvaLI AML-Regelsprache, Operatoren und Aktionen
  • Fallkonsistenz: Entscheidung, Flags und die Meldeanforderung müssen untereinander und mit den eingegebenen Zahlen übereinstimmen
  • Verhaltenssprache: Keine klinischen Diagnosen, kein Verdacht aufgrund geschützter Merkmale, angemessene Formulierung für Opfer
  • Grounding: Jedes Zitat muss existieren und jede Zahl muss im zitierten Abschnitt vorkommen
  • Kopiergrenzen und Zuordnung der Jurisdiktion

Nahezu identische Duplikate werden mit MinHash bei einem Ähnlichkeitsschwellenwert von 0,85 entfernt. Evaluierungsdaten werden nach Kunden getrennt, und 10 % der Abschnitte werden vollständig zurückgehalten.

4. Aufgabentaxonomie

Das Design begann mit 30 Kernkompetenzen und ist auf mehr als 50 Aufgabencodes angewachsen.

FamilieBeispiele
FallbearbeitungFallbewertung, Alert-Triage, Entwurf von SAR-Berichten, Konsistenzprüfung im Vier-Augen-Prinzip
Regeln und BerichteRegelvorschläge in der Regelsprache der Plattform, Kalibrierung, Berichtsdefinitionen, SQL
WissenFundierte Fragen und Antworten zu Vorschriften, Typologien und Red Flags, Prüfungsfragen, Experten-Erklärungen
ScreeningBewertung von Sanktions- und PEP-Treffern, Travel Rule, Adverse Media
VerhaltenswissenschaftBaselines, Abweichungen, Viktimisierung, Lebenszyklus von Finanzagenten, Social Engineering, Transkripte
Plattform und ToolsMCP-Tool-Ketten, strukturierte Ausgabe
SicherheitVerweigerungen, Resistenz gegen Prompt-Injection, unzureichende Beweislage
DokumenteAuslesen von IDs und MRZ, Geschäftsdokumente, Fälschungsmerkmale (geplant)

Die Antworten sind auf neun Rollen ausgerichtet: Compliance, Betrugsprävention, Verhaltensanalyse, interne Revision, Psychologie, Betriebsprüfung, Risiko, Management sowie Fintech und Krypto.

5. Training

5.1 Pilotphase (v0)

Ein kleines Pilotmodell, das auf einigen hundert Beispielen trainiert wurde, wurde am 24. September 2026 fertiggestellt. Es steigerte die Prüfungsgenauigkeit von 0,77 auf 0,87 und die fundierten Antworten von 0,50 auf 0,78, was ausreichte, um den vollständigen Durchlauf zu rechtfertigen.

5.2 v1

v1 ist ein LoRA-Feintuning eines quelloffenen Vision-Language-Basismodells, trainiert in bf16 für eine Epoche. Der Loss wurde nur auf den eigenen Antworten des Modells berechnet, und der Vision-Encoder blieb unberührt, sodass TruvaLI die Fähigkeit seines Basismodells zum Lesen von Bildern beibehält. Das logische Denken (Thinking) wurde nicht trainiert.

Der v1-Mix wurde von Wissen dominiert: Experten-Erklärungen (52 %), Prüfungsfragen (28 %), fundierte Fragen und Antworten (8 %), allgemeines Verhalten und Identität (5 %), Typologien (3 %), Social Engineering (2 %) und Adverse Media (2 %). 80 % davon waren auf Türkisch. Dieses Ungleichgewicht ist für eine erste Version beabsichtigt und ist die Hauptänderung in v1.3 und v1.4: Zwei Drittel des Mixes bestehen dann aus Fähigkeiten wie Tool-Nutzung, Fall-JSON, Regeln und SQL.

5.3 Bereitstellung

TruvaLI wird quantisiert und auf unserem eigenen Server bereitgestellt. PDFs werden Seite für Seite gerendert und vom Modell selbst transkribiert, sodass Dokumente den Server nie verlassen. Der Thinking-Modus ist dasselbe Modell, bei dem das logische Denken zur Inferenzzeit eingeschaltet wird.

6. Evaluierung

v1.1 im Vergleich zu seinem unberührten Basismodell:

TestFragenBasisTruvaLI v1.1
Compliance-Prüfung (Multiple Choice)50088,8%92,6%
Fundierte Fragen und Antworten, Antwort im Abschnitt39189,3%91,6%
Fundierte Fragen und Antworten, Antwort nicht im Abschnitt977,8%100%
Allgemeines Verhalten und Identität5240,4%90,4%
Valide strukturierte JSON-Ausgabe280%89,3%

Der Prüfungspool umfasst 17.976 Fragen; der fundierte Test greift auf 803 zurückgehaltene Abschnitte zurück. Die Ergebnisse für unbeantwortbare Fragen und JSON stammen aus kleinen Stichproben und sind als Richtungsweiser, nicht als präzise Messung zu verstehen. Ab v1.4 wird jedes Release an größeren Datensätzen gemessen: mindestens 50 unbeantwortbare Fragen, mindestens 200 JSON-Aufgaben, 150 SQL-Fragen in jeweils drei Dialekten und 50 Fragen pro Sprache für multilingualen Drift.

7. Sicherheit

Die Kernregeln gelten für jede Konversation: kein Tipping-off, keine Hilfe bei Geldwäsche oder Umgehung, keine Entschlüsselung maskierter Daten, eingebettete Anweisungen werden als Daten behandelt, Schreibvorgänge werden über eine Vier-Augen-Freigabe geleitet und keine erfundenen Zahlen. Die Verhaltensaufgaben fügen eigene Grenzen hinzu: keine klinischen Diagnosen, kein Verdacht aufgrund von Alter, Geschlecht oder Nationalität und kein Anspruch auf Lügendetektion.

Spezielle Sicherheits- und Verweigerungs-Trainingssets existieren, waren aber nicht Teil von v1; in v1.1 werden diese Regeln über den System-Prompt durchgesetzt. Sie sind Teil des Trainings von v1.3.

8. Einschränkungen

  • Tool-Nutzung: v1 enthielt keine Beispiele für Tool-Nutzung. Ohne den Thinking-Modus schlug das Modell bei allen vier Tool-Call-Tests fehl; mit Thinking-Modus bestand es alle vier.
  • Zahlen: Im Test gab das Modell eine Meldefrist von 24 bis 48 Stunden an, obwohl die Vorschrift zehn Werktage vorsieht. Zahlen und Fristen müssen überprüft werden.
  • Thinking wurde nicht trainiert: Der Thinking-Modus funktioniert, aber das logische Denken selbst war nie Teil der Trainingsdaten.
  • Identität: Ohne seinen System-Prompt stellt sich das Modell nicht immer korrekt vor.
  • Abdeckung: Finanzagenten, Verhaltensanalyse, türkischsprachiger Betrug und klassische Typologien sind unterrepräsentiert.
  • Sprachen: Die Sprachen der Zielmärkte machen 1 % der Trainingsdaten von v1 aus.
  • Geschwindigkeit: Die Antworten sind auf dem aktuellen Server langsamer als gewünscht.

9. Roadmap

Die Schritte nach v1.1 erfolgen als monatliche Minor-Releases bis Juni 2027: neun Stück, von v1.2 bis v1.10. Keines ist ein unvorhersehbarer Sprung; jedes fügt einen Teil hinzu, den ein Compliance-Modell haben sollte. Die ersten drei werden noch vor Ende dieses Jahres ausgeliefert.

Releases

ReleaseDatumHauptschritt
v1.2Oktober 2026Schnellere Antworten; ein Retrieval-Tool, das während der Beantwortung das Quellenarchiv durchsucht
v1.3November 2026Tool-Nutzung und Fallbewertung als JSON; Sicherheits- und Verweigerungstraining
v1.4Dezember 2026Regeln und Kontrollen, SQL und Berichterstattung; Präferenztraining; 4.000 Fallkarten; 3 Sektoren
v1.5Januar 20275 Trainingssprachen; übersetzter regulatorischer Kern für Montenegrinisch, Kroatisch, Deutsch und Aserbaidschanisch
v1.6Februar 2027Fortgesetztes multilinguales Pre-Training
v1.7März 2027Anonymisierte Fallkarten aus unseren eigenen geschlossenen Fällen; 6 Sektoren; 10.000 Fallkarten
v1.8April 2027Reinforcement Learning mit Verifizierern: SQL, Regeln und Tool-Ketten werden per Code bewertet
v1.9Mai 2027Dokumentenphase; 8 Sektoren
v1.10Juni 202710 Sprachen; 10 Sektoren; 30.000 Fallkarten; monatliche Daten-Releases und vierteljährliches Retraining

Vor Ende dieses Jahres: v1.2, v1.3 und v1.4

  • Schnellere Antworten durch Speculative Decoding
  • Ein Retrieval-Tool, damit TruvaLI während der Beantwortung im Quellenarchiv nachschlagen kann
  • Fähigkeiten machen zwei Drittel des Trainingsmixes aus: Tool-Nutzung, Fallbewertung als JSON, Regel- und Kontrolldesign, SQL und Berichtsdefinitionen
  • Die Sicherheitsregeln, die heute über den System-Prompt durchgesetzt werden, werden dem Modell selbst antrainiert
  • Präferenztraining auf Paaren, die aus abgelehnten Kandidaten, eigenen Fehlern von v1 und 👎-Bewertungen erstellt wurden
  • 4.000 Fallkarten aus Nachrichten, Gerichtsentscheidungen und veröffentlichten Berichten, jeweils umgeschrieben für Banken, Zahlungsabwicklung und E-Geld sowie Krypto-Dienstleister
  • Eine Expertenprüfung von 1.500 Beispielen und eine verifizierte Liste regulatorischer Kennzahlen

Bis Juni 2027: v1.5 bis v1.10

  • Training in fünf Sprachen: Türkisch, Englisch, Montenegrinisch/Kroatisch, Deutsch und Aserbaidschanisch
  • Fortgesetztes Pre-Training auf dem nativen und übersetzten Archiv, sodass TruvaLI die Marktsprachen fließend liest und schreibt und deren eigene Regulierung lernt
  • Unsere eigenen geschlossenen Fälle, vertraglich und nach einem KVKK-konformen Verfahren anonymisiert, als Fallkarten; Rohdaten fließen nie in das Training ein
  • Sechs, dann acht, dann zehn Sektoren: Wetten und Glücksspiel, Versicherungen, Devisenwechsel und Edelmetalle, Immobilien, E-Commerce und Marktplätze
  • Reinforcement Learning, bei dem die Antwort per Code überprüft werden kann: SQL-Ergebnisse, Regel-Testfälle, Ergebnisse von Tool-Ketten und regulatorische Kennzahlen
  • Eine Dokumentenphase: Auslesen von IDs und MRZ, Geschäftsdokumente, Fälschungsmerkmale und Unterstützung bei Video-KYC
  • Zehn Sprachen und 30.000 Fallkarten, wobei ein Viertel der Trainingsbeispiele auf realen Fällen basiert
  • Nach v1.10 monatliche Daten-Releases, vierteljährliches Retraining und eine jährliche Überprüfung des Basismodells
  • Ein Gold-Standard-Set, das von der TruvaLI-KI-Community überprüft und gepflegt wird

On-Premise

Die On-Premise-Bereitstellung wartet nicht auf ein Release. Institute, die TruvaLI auf ihren eigenen Servern zusammen mit TruvaLI AML betreiben möchten, können dies jederzeit direkt anfordern. Siehe On-Premise-Bereitstellung für Details oder schreiben Sie uns, um danach zu fragen.

Release Gates

Jedes Release wird an denselben Sets gemessen, die jedes Mal wachsen, und wird nicht ausgeliefert, wenn es hinter das vorherige Release zurückfällt. Dies sind die Releases, bei denen die Zielvorgaben steigen:

Metrikv1.4v1.7v1.9v1.10
Compliance-Prüfung≥92%≥93%≥93%≥94%
Fundierte Fragen und Antworten≥91%≥92%≥93%≥94%
Ruft ein Tool auf, wenn eines benötigt wird≥90%≥93%≥95%≥97%
Genauigkeit der SQL-Ergebnisse, drei Dialekte≥85%≥88%≥90%≥93%
Regeln bestehen ihre Testfälle≥85%≥90%≥92%≥95%
Regulatorische Kennzahl korrekt oder zur Überprüfung markiert≥95%≥97%≥97%≥98%
Multilingualer Drift, Marktsprachen≥85%≥90%≥92%≥94%
Übereinstimmung mit der Entscheidung bei unseren eigenen geschlossenen Fällen—≥75%≥80%≥85%

10. Mitwirken

Die Roadmap hängt von Menschen ab, die Compliance-Arbeit beruflich machen. Wenn Sie Antworten überprüfen, falsche Zahlen aufdecken, eine Sprache prüfen oder Quellen vorschlagen können, besuchen Sie die Community-Seite.

Ähnliche Beiträge