StartseiteExpertise03 · KI-Integration

KI-Integration

RAG-Pipelines, Embeddings und Vektorsuche mit pgvector — produktiv im Einsatz, nicht als Demo. Diese Seite zeigt, woran das scheitert, wie ich es gebaut habe und woran du es nachprüfen kannst.

Die Arbeit im Lauf: 38 PDFs werden geschnitten, eingebettet — und eine Frage bekommt eine Antwort mit QuelleKI-generiert
Die Arbeit, im Lauf — die einzige Frage, mit der jemand hier ankommt.21:9
Bereich
03 von 04
Stack
11 Technologien
Referenz
KI-Exposé-Generator
Was die Arbeit hinterlässt: die chunks-Tabelle mit 2.412 Zeilen, HNSW- und GIN-IndexKI-generiert
Was die Arbeit hinterlässt: die Tabelle, die antwortet.21:9

Die Ausgangslage: die Suche findet nichts

Das Wissen liegt da — in PDFs, Tickets und auf Laufwerken — aber niemand findet es. Die Suche findet Wörter, nicht Antworten; also fragt man den Kollegen, und der fragt den nächsten.

Posteingang voller Wo-finde-ich-Fragen: Preisliste, Vertrag, DatenblattKI-generiert
Dieselbe Frage, jede Woche neu gestellt. Die Antwort existiert — sie steht nur in niemandes Suchindex.16:9
Screencast · null Treffer für ein Dokument, das eine Zeile tiefer im Ordner liegt
Null Treffer, obwohl die Datei eine Zeile tiefer sichtbar ist. Die Suche vergleicht Zeichen, nicht Bedeutung.21:9

Arbeitsweise

Erst der Bestand, dann das Modell: Dokumente werden an ihren Überschriften geschnitten, eingebettet und mit Volltext kombiniert. Getestet wird gegen echte Fragen aus dem Alltag — erst über 90 % Treffer@3 geht es in Betrieb.

Die Methode im Lauf: Pipeline links, Retrieval-Test mit Scores rechtsKI-generiert
Schneiden, einbetten, prüfen — ein Durchlauf16:9

BelegeDavor und danach2 Exponate

Das Denken vor dem Code: handgezeichnete Chunking-Strategie auf PapierKI-generiert
Davor: an Überschriften schneiden, nie mitten im SatzFoto · 16:9
Danach: 50 Testfragen aus dem Alltag, Treffer@3 bei 94 ProzentKI-generiert
Danach: der Schritt, der es bewiesen hat16:9

Das Referenzprojekt zu diesem Bereich

Eine Fähigkeit ohne Projekt dahinter ist eine Liste von Technologien. Das hier ist das Projekt — mit der Zahl, die dabei herauskam, und der Fallstudie, in der du sie nachlesen kannst.

Screencast: der Exposé-Generator läuft — PDF-Vorschau links, Log rechts

Recruiting · KI

3 Min

pro Exposé · vorher 45

Exposés, die sich in drei Minuten selbst schreiben

Aus Bewerbungen und Lebensläufen wird ein fertiges Kandidatenprofil — Claude schreibt die Texte, die Pipeline setzt das Dokument.

Next.js TypeScript PostgreSQL pgvector RAG Claude / GPT / Gemini AWS (S3, Lambda) Docker

Blick in die Pipeline: kommentierter Code und das Log eines fertigen ExposésKI-generiert
Derselbe Fall, von innen: die Pipeline16:9
Derselbe Fall, von außen: das gedruckte Exposé auf dem StahltischKI-generiert
Derselbe Fall, von außen: das ErgebnisFoto · 16:9

Alle Referenzprojekte

Woran ich gearbeitet habe

Vier Arten von Arbeit, jede mit dem einen Bild, das sie prüfbar macht. Nummeriert zum Draufzeigen — nicht, weil eine auf die andere folgt: jede steht für sich.

  • 01

    Dokumentenverarbeitung und automatisches Parsen

    Parser: links die Rechnung, rechts die extrahierten Felder mit HakenKI-generiert
  • 02

    Semantische Suche über eigene Datenbestände

    Screencast: semantische Suche mit Quellenangabe
  • 03

    Chat- und Voicebots mit Anbindung an bestehende Systeme

    Assistent mit Systemanbindung: Bestandszahl mit Quelle ERP, liveKI-generiert
  • 04

    Ablösung von KI-SaaS durch integrierte Eigenentwicklung

    Die Rechnung: 1.480 Euro SaaS gegen 90 Euro Eigenbetrieb pro MonatKI-generiert

Der Stack: pgvector, RAG, HNSW

Nach Ausgangslage und Arbeitsweise fragt niemand mehr, was installiert ist — sondern ob davon etwas echt ist. Die Zeile bleibt, zwei Rahmen darunter antworten.

Claude GPT Gemini pgvector PostgreSQL Python Node Docker Twilio RAG HNSW

Im Betrieb

API-Log im Betrieb: Modelle, Tokens, Latenz — mit Fallback-ZeileKI-generiert

Wiederholbar

Das, was den Betrieb wiederholbar macht: Compose-Datei und CI-WorkflowKI-generiert

Größenordnung

Klein hieß: ein Skript, das ab Freitag Rechnungs-Mails sortiert. Groß hieß: Suche und Assistenz über 14.000 Dokumente und drei Abteilungen — der Aufwand steckte in den Sonderfällen.

Kleiner Fall
Suche · Über den BestandKI-generiert
Existiert bis Freitag, lässt sich stillhaltenFoto · 16:9
Großer Fall
Pipeline · Die SonderfälleKI-generiert
Ein Prozess — ein Standbild wäre ein willkürlicher Moment16:9

Häufige Fragen

Fünf Fragen, die zu diesem Bereich regelmäßig kommen — beantwortet aus den Projekten, in denen sie aufkamen.

Was ist RAG, und wann ist es einem Chatbot vorzuziehen?
RAG heißt: erst in den Dokumenten suchen, dann das Modell mit dem Fund antworten lassen. Es ist die richtige Bauform, sobald die Antwort in den eigenen Unterlagen steht und nicht im Weltwissen des Modells.
Wo lagen die Dokumente — im eigenen Haus oder beim Modellanbieter?
Der Index lag in der PostgreSQL des Kunden. An das Modell ging nur der Ausschnitt, den die Frage braucht — und wo auch das zu viel war, lief das Modell auf der eigenen Maschine.
Wie viele Dokumente verträgt eine Vektorsuche mit pgvector?
14.000 Dokumente über drei Abteilungen laufen produktiv, mit HNSW als Index. Die Grenze ist in der Praxis nicht die Zahl der Dokumente, sondern wie sauber sie geschnitten sind.
Woran wurde gemessen, ob die Suche gut genug ist?
An echten Fragen aus dem Alltag, nicht an einer Demo. Das Testset bestand aus Fragen, die tatsächlich gestellt wurden; unter 90 % Treffer@3 ging nichts in Betrieb.
Braucht es eine eigene Vektordatenbank wie Pinecone?
Selten. pgvector sitzt in der Datenbank, die ohnehin läuft — ein System weniger, ein Backup weniger, eine Rechnung weniger. Ab dreistelligen Millionen Vektoren sieht das anders aus.

Kontakt

Eine halbe Minute, dann weißt du mehr.

Eine halbe Minute dazu, woran ich arbeite und wie. Bleibt eine Frage offen, schreib mir — Antwort innerhalb eines Werktags.

Vier Bereiche

KI-Integration steht selten allein — in den meisten Projekten greift dieser Bereich in mindestens einen der anderen. Deshalb gehört die Kette zusammen.

Eine Änderung läuft durch vier Schichten: Interface, API, Datenbank, Cloud — mit Zeitstempel an jeder StationKI-generiert
Eine Änderung, vier Schichten — warum die Bereiche zusammengehören21:9
Bestellliste und Detailansicht nebeneinander: ORD-4418 ausgewählt, Netto, MwSt. und Summe danebenKI-generiert

01

Full-Stack-Entwicklung

React- und Next.js-Frontends mit SSR und Server Components. Backends mit TypeScript, Python und PostgreSQL.

Deployment-Protokoll nach dem Push: Image, Push, Migrationen, Probe, Routing — live nach 1:44KI-generiert

02

Cloud & Deployment

AWS-Architektur, Deployment über Docker, sauberes Secrets-Management. Oder eigener Server, wenn das die bessere Rechnung ist.

Sync-Lauf 4471: 3.184 Datensätze, eine Abweichung — ERP 214 gegen Shop 209, Entscheidung HOLDKI-generiert

04

Systemintegration

Middleware zwischen Systemen, die nicht miteinander reden. Marktplatz-Anbindungen, Bestands- und Bestelldatensynchronisation.

Alle vier Bereiche