Skip to main content
AI Tool Radar
OSI-openVektoren, Dokumente und Extraktion

langextract

google

Python-Bibliothek von Google für LLM-gestützte strukturierte Extraktion mit Source Grounding.

36.8k Stars(Stand 2026-06-07)Auf GitHub ansehen

Was ist langextract?

Eine Python-Bibliothek von Google, die ein LLM nutzt, um strukturierte Information aus unstrukturiertem Text zu ziehen, und dann jede Extraktion an ihre exakte Stelle im Quelltext zurückbindet ('Source Grounding') plus eine interaktive HTML-Ansicht erzeugt. Sie ruft selbst kein Modell, du bringst einen Provider mit: Gemini (Default), OpenAI, oder lokale Modelle via Ollama (ohne API-Key).

langextract im Detail

Saubere, strukturierte Daten aus unordentlichem Fließtext zu ziehen, ist eine Aufgabe, die sich seit Jahren der einfachen Automatisierung entzieht. Reguläre Ausdrücke scheitern am ersten Sonderfall, und füttert man Dokumente direkt in ein großes Sprachmodell, entsteht oft plausibles JSON, dem man schwer trauen kann, weil unklar bleibt, aus welcher Stelle der Quelle jedes Feld stammt. langextract ist eine Python-Bibliothek von Google, die genau diese Lücke adressiert. Man beschreibt in einem Prompt, was man möchte, liefert ein paar ausgearbeitete Beispiele, und die Bibliothek extrahiert mit einem LLM die gewünschten Felder. Ihr prägendes Merkmal ist Source Grounding: Jede Extraktion ist an die exakte Zeichenposition im Originaltext geknüpft, sodass man nachvollziehen kann, woher jeder Wert kommt, statt dem Modell blind zu vertrauen.

Im Kern ist langextract eine Orchestrierungsschicht und kein eigenes Modell. Es ruft einen Provider auf, den man selbst wählt: standardmäßig Gemini, dazu OpenAI, Vertex AI oder lokale Modelle über Ollama ganz ohne API-Key. Man definiert die Extraktionsaufgabe als Prompt plus ExampleData-Objekte, ein Few-Shot-Muster, bei dem die Beispiele das Verhalten des Modells und die erwartete Ausgabeform steuern. Die Bibliothek fordert das Modell auf, Extraktionen wörtlich und in Reihenfolge zurückzugeben, ordnet sie dann ihrer Position in der Quelle zu und speichert ein char_interval. Lange Dokumente werden in Abschnitte zerlegt, parallel verarbeitet und können in mehreren Durchläufen extrahiert werden, um die Trefferquote zu erhöhen. Lässt sich eine Extraktion nicht in der Quelle finden, kommt char_interval als None zurück, was Halluzinationen sichtbar macht statt sie zu verstecken. Zusätzlich erzeugt das Tool eine eigenständige, interaktive HTML-Ansicht, die jede Entität im Kontext hervorhebt.

Die naheliegende Zielgruppe sind alle, die Dokumente, Berichte oder Notizen in strukturierte Datensätze überführen und dabei auf nachvollziehbare Herkunft angewiesen sind. Die Beispiele des Projekts sind aufschlussreich: das Extrahieren von Medikamenten, Dosierungen und Verabreichungswegen aus klinischen Texten, das Strukturieren von Radiologiebefunden und das Herausziehen von Figuren und Beziehungen aus dem vollständigen Text von Romeo und Julia, um die Skalierung auf lange Eingaben zu zeigen. Darüber hinaus eignet es sich für Forschungsteams, die qualitative Daten kodieren, für Analystinnen und Analysten, die Zahlen und Daten aus Geschäftsberichten ziehen, und für Entwickler, die Pipelines bauen, die Support-Tickets, Verträge oder Laborberichte in abfragbare Tabellen verwandeln. Die HTML-Visualisierung macht es auch für Review-Prozesse nützlich, in denen ein Mensch jedes Feld gegen die Originalstelle prüft, bevor es in eine Datenbank wandert.

Die ehrlichen Einschränkungen sind real. Bei Cloud-Modellen hängt man von einer externen LLM-API ab, was laufende Token-Kosten bedeutet und dazu führt, dass der Text die eigene Maschine verlässt. Lokale Inferenz über Ollama vermeidet beides, doch dann trägt man die Last des Modell-Hostings und akzeptiert den Qualitätskompromiss, den kleinere lokale Modelle oft mitbringen. Die README sagt unmissverständlich, dass dies kein offiziell unterstütztes Google-Produkt ist, es gibt also kein SLA, keinen garantierten Support-Kanal, und Gemini-Modellversionen haben Abkündigungsdaten, die man selbst im Blick behalten muss. Die Genauigkeit ist eine Angabe des Projekts selbst und hängt stark vom Modell, vom Prompt und von der Qualität der Beispiele ab. Die medizinischen Beispiele kommen mit ausdrücklichen Hinweisen, dass sie illustrativ und nicht für den klinischen Einsatz gedacht sind, was ein fairer Hinweis darauf ist, wie viel Validierung ein ernsthafter Einsatz noch braucht.

Gegenüber verwalteten Alternativen wie Google Document AI oder den Structured-Output-Funktionen kommerzieller LLM-Plattformen tauscht langextract Garantien gegen Transparenz und Kontrolle. Solche Dienste bieten Support, eine geklärte Compliance-Lage und schlüsselfertige Pipelines, zeigen aber selten, wo genau jedes Feld herstammt. Das Source Grounding und die Option ohne API-Key lokal zu laufen sind ein echtes Unterscheidungsmerkmal für Teams, die Auditierbarkeit hoch gewichten oder keinen Text in die Cloud schicken dürfen. Greifen Sie zu, wenn Herkunftsnachweis nicht verhandelbar ist und Sie bereit sind, Prompts und Beispiele zu feilen. Behandeln Sie es als zu früh, wenn Sie ein unterstütztes Produkt mit vertraglichen Garantien brauchen oder wenn Sie weder Text in ein Cloud-Modell senden noch Ollama lokal betreiben können. Für alle dazwischen ist es ein gut durchdachter, permissiv lizenzierter Baustein.

Vor- & Nachteile

Pros

  • Apache-2.0, permissiv und OSI-open, kein Copyleft
  • Provider-agnostisch: Cloud (Gemini/OpenAI/Vertex) oder voll lokal via Ollama ohne API-Key
  • Source-Grounding und eine HTML-Visualisierung out-of-the-box sind ein echtes Unterscheidungsmerkmal

Cons

  • Für Cloud-Modelle braucht sie eine externe LLM-API: laufende Token-Kosten, und dein Text verlässt die Maschine (lokal nur via Ollama)
  • Das README sagt klar 'this is not an officially supported Google product', kein SLA
  • Genauigkeit ist eine eigene Projektangabe und hängt vom gewählten Modell, Prompt und den Beispielen ab

Lizenz

Apache-2.0 (OSI-open)

Wann interessant

Dokumente, Berichte oder Notizen mit nachvollziehbarer Herkunft in strukturierte Daten verwandeln.

Wann zu früh

wenn du ein unterstütztes Produkt mit Garantien brauchst, oder keinen Text an ein Cloud-Modell senden kannst und Ollama nicht lokal betreiben willst. Es existiert keine kommerzielle Variante, und die benötigten LLM-Provider haben kein Endkunden-Affiliate-Programm.

Dieses Repo war in der Ausgabe 2026-06 des Open-Source-KI-Radars.