Datenintegration ist ein zentraler Bestandteil moderner Unternehmensprozesse. Doch was tun, wenn unstrukturierte Daten, wie E-Mail-Signaturen, schnell und effizient in ein standardisiertes Format überführt werden sollen?
Der Anwendungsfall
Im Fokus steht die Automatisierung der Erstellung von Kontakten in einem CRM-System. Ziel ist es, E-Mail-Signaturen in ein JSON-Format zu konvertieren, das mit der CRM-API kompatibel ist. Ein Beispiel für eine E-Mail-Signatur ist:
--------- Wettbewerbsfähigkeit sichern – datenbasiert entscheiden. Wir helfen dabei. ---------------------------------------------------------------------------------- Marc Mai Senior Software Architect Teamleiter Data Driven Solutions doubleSlash Net-Business GmbH Otto-Lilienthal-Str. 16 D-88046 Friedrichshafen Fon: +49 7541 / 70078-XXX Mob: +49 123 / 4567890 info@doubleSlash.de http://doubleSlash.de ---------------------------------------------------------------------------------- doubleSlash Net-Business GmbH Geschäftsführung: Konrad Krafft, Andreas Strobel, Patrick Schmerbach Sitz, Registergericht: Friedrichshafen, Amtsgericht Ulm HRB 631718 ----------------------------------------------------------------------------------
Die Umsetzung

Infrastruktur
Der Ollama Server wird als lokaler LLM-Service genutzt. Dies reduziert die Abhängigkeit von externen APIs und ermöglicht eine flexible Anpassung an verschiedene Anforderungen. Konkrete Details zu dieser Infrastruktur sind in diesem Blogbeitrag beschrieben. Alternativ kann auch ein Cloud-Dienst wie ChatGpt genutzt werden.
Mapping-Skript
Das zentrale Element des PoCs ist ein Python-Skript, das folgende Schritte umfasst:
- Eingabe: E-Mail-Signatur als Text.
- Prompt-Definition: Ein speziell gestalteter Prompt leitet das LLM an, relevante Daten zu extrahieren und im JSON-Format zurückzugeben.
- API-Integration: Das LLM wird über eine lokale REST-API angesprochen.
Ein Beispiel in Pseudocode:
# E-Mail-Signatur und Zielformat einlesen
prompt = """
The following mail contains a signature:
{E-Mail-Signatur}
only reply with a json and no further content in the following format where you put in the right details extracted from the mail:
{Ziel-Datenformat}
"""
# Prompt an LLM senden, Antwort parsen und weiterverarbeiten
Ergebnisse
Bereits mit einer Basiskonfiguration liefert das LLM hervorragende Ergebnisse bei der Extraktion von Informationen wie Name, Position, Firma und Kontaktdaten:
{
"properties": {
"firstName": "Marc",
"lastName": "Mai",
"title": "Senior Software Architect, Teamleiter Data Driven Solutions",
"company": "doubleSlash Net-Business GmbH",
"street": "Otto-Lilienthal-Str. 16",
"city": "Friedrichshafen",
"country": "Germany",
"phone-mobile": "+49 123 / 4567890",
"eMail": "info@doubleSlash.de",
"website": "http://doubleSlash.de"
}
}
Um die Qualität des Ergebnisses zu überprüfen, ist es denkbar, die Antwort einer Json-Schema Validierung zu unterziehen.
Potenziale und Ausblick
Der Einsatz von LLMs im Datenmapping zeigt eindrucksvoll, wie moderne KI-Technologien Unternehmen dabei helfen können, zeitaufwändige Prozesse zu automatisieren.
Um die Genauigkeit weiter zu steigern, könnten zukünftige Iterationen des Prompts mit konkreten Beispielen erweitert werden. Sofern bei der Schemaprüfung des Ergebnisses Fehler erkannt werden, könnte man das LLM nochmals mit dem konkreten Fehler prompten und anweisen, den Datensatz zu korrigieren. Auch die Nutzung umfangreicherer LLMs (wie z. B. phi4) ist denkbar, um Verarbeitungsgeschwindigkeit und die Qualität der Datentransformation zu verbessern.
Neben dem hier gezeigten Beispiel ist die Methodik auch auf viele weitere Anwendungsfälle übertragbar. Denkbare Beispiele sind das Konvertieren von eingehenden Dokumenten (z. B. Rechnungen oder Bewerbungsunterlagen) oder das Standardisieren von Websuche-Ergebnissen.
An Grenzen stößt die Methode dann, wenn 100 % deterministische Ergebnisse erzeugt werden müssen, da die Ausgaben von LLMs keinem Determinismus folgen.
Fazit
Das datenbasierte Mapping mit LLMs bietet eine flexible Lösung, um unstrukturierte Daten schnell und effizient in nutzbare Formate zu transformieren.
Wir nutzen diese heute bereits in unseren Produkten, beispielsweise in unserer Data Factory, um schnell und effizient Datentransformationen zu realisieren.



