↓ / → weiter

Gesprächsgrundlage · M.PAGE GmbH

Das Unternehmens­gedächtnis braucht einen ersten Anwendungsfall.

Ich habe einen gebaut. Er verkauft sich an Kunden, die Sie schon haben.

Vier Lücken in der aktuellen Planung · vier konkrete Korrekturen · vier messbare Tests · ein lauffähiger Anwendungsfall: GEO-Monitoring.

02

Zuerst das Richtige

Drei Punkte Ihrer Analyse halte ich für belastbar.

Das Problem ist echt

Verstreutes Wissen kostet real Arbeitszeit, und Unternehmen zahlen dafür, das zu lösen. Das ist kein konstruierter Bedarf.

Die Preishypothese ist ehrlich

Zahlen als Hypothese zu kennzeichnen statt als Prognose ist ungewöhnlich und richtig. Genau so gehört das gemacht.

Das Abnahmekriterium zielt richtig

„Eine andere Person kann es anhand der Dokumentation reproduzieren“ – Reproduzierbarkeit ist tatsächlich der Kern. Darauf komme ich zurück.

Mein Einwand betrifft nicht die Idee. Er betrifft die Reihenfolge.

03

Die Lücke

Zwischen Problem und Preis fehlt die Mitte.

Folie 2Das Problem – klar beschrieben
Folie 3Vier Werkzeuge: Obsidian, Hermes, Codex/Cowork, AWS
Folie 412 Wochen, drei Phasen
Folie 5Preise und 216.000 € Jahresumsatz

Was dazwischen nicht vorkommt

  • Kein Anwendungsfall – der wird erst in Woche 5 gewählt
  • Kein Kunde – die Zielgruppe wird erst eingegrenzt
  • Kein Datenmodell – was wird gespeichert, in welcher Form?
  • Keine Definition von „arbeitet“ oder „handlungsfähig“
  • Keine wiederkehrende Leistung, die den Retainer trägt

Prüfung: Tauschen Sie alle vier Logos gegen vier andere aus. Die Präsentation liest sich unverändert. Das heißt, die Logos sind nicht der Plan.

04

Lücke 1 · die entscheidende

Wissen ist nicht eine Sache, sondern drei.

ArtBeispielAnforderungGehört in
Datensätze Was wurde als Preis vereinbart · wer verantwortet dieses Projekt · was wurde im März entschieden Exakt, abfragbar, berechtigt, auditierbar Datenbank
Dokumente Playbooks, Positionierung, Gesprächsnotizen Unscharfe Suche genügt Dateien / Obsidian
Belege Die E-Mail, das PDF, das Angebot, die KI-Antwort Unveränderlich, mit Zeitstempel Objektspeicher

Obsidian deckt ausschließlich die Mitte ab. Baut man Datensätze als Notizen, wirkt die Demo beeindruckend – und im zweiten Monat fragt jemand „was war der vereinbarte Preis?“, der Agent antwortet selbstsicher aus einer veralteten Notiz, und das Projekt ist beim Kunden verbrannt.

05

Lücke 2

Es fehlt der Begriff „überholt“.

Eine Notiz von 2024 und eine von 2026 nennen beide einen Preis. Beide sind auffindbar. Der Agent nimmt eine davon. Niemand weiß, welche.

Das ist der am häufigsten fehlende Baustein in jedem Second-Brain-Projekt – und er lässt sich nicht nachträglich einbauen, weil er im Datenmodell sitzt.

Die Korrektur

Jede Aussage trägt gültig_ab, gültig_bis, ersetzt_durch und ihre Quelle.

Bei Widerspruch zeigt das System den Widerspruch, statt ihn still aufzulösen. „Ich finde zwei Antworten, die neuere ist vom 14. Juli, hier sind beide“ ist vertrauenswürdig. Eine selbstsichere falsche Antwort ist es nicht.

06

Lücke 3

Eine Kopie driftet. Ein Index nicht.

Die Fakten liegen bereits in E-Mail, CRM, Buchhaltung, Kalender und Projekttool. Werden sie nach Obsidian kopiert, entsteht eine zweite Wahrheit, die ab dem ersten Tag altert.

Kopie

Zwei Stände, die auseinanderlaufen. Niemand weiß, welcher gilt. Pflege wird zur Daueraufgabe.

Index mit Herkunft

Jede Aussage speichert, woher sie kommt, wann sie gelesen wurde und wie frisch sie ist. Veraltetes ist sichtbar veraltet. Nichts wird von Hand kopiert.

Merkmal eines Index: man kann ihn löschen und in zehn Minuten neu aufbauen. Genau daran erkennt man, dass er nicht die Quelle der Wahrheit ist.

07

Lücke 4 · die teuerste

„Ausführbar“ ist nicht definiert – und daran scheitert Ihr eigenes Abnahmekriterium.

„Eine andere geeignete Person kann den ausgewählten Anwendungsfall anhand der Dokumentation reproduzieren.“

Ein Agent, der seine Schritte selbst wählt, kann diesen Test nicht bestehen. Zwei Durchläufe, zwei Wege, zwei Ergebnisse.

Die Korrektur: Prozeduren

Abläufe werden als benannte Schritte festgeschrieben – definierte Eingaben, definierte Ausgaben, Prüfungen dazwischen, Versionsnummer. Der Agent führt die Prozedur aus, er erfindet sie nicht. Wo Urteilsvermögen nötig ist, erstellt er einen Entwurf und ein Mensch gibt ihn frei.

08

Zwei Einwände, die vom Kunden kommen werden

Besser jetzt beantwortet als nach der Pilotrechnung.

Mitbestimmung und DSFA

Ein System, das E-Mails und Dokumente von Mitarbeitenden einliest, ist mit hoher Wahrscheinlichkeit mitbestimmungspflichtig und braucht eine Datenschutz-Folgenabschätzung.

Ohne diese Vorarbeit stoppt die Rechtsabteilung des Kunden das Projekt – nach dem Pilotangebot. Zusätzlich: Löschung muss den Suchindex und die Embeddings erreichen, nicht nur die Dateien.

Anwaltlich zu prüfen – aber vor dem ersten Angebot, nicht danach.

Der Retainer hat keine Leistung

1.500 bis 8.000 € monatlich setzen voraus, dass monatlich etwas Wertvolles ankommt. Der Nutzen eines Gedächtnissystems liegt aber am Anfang: einrichten, dann steht es.

Was landet in Monat sieben beim Kunden im Postfach? Lautet die Antwort „Zugang zum System“, kündigt dieser Retainer.

Korrektur: jeder Retainer hängt an einer wiederkehrenden Ausgabe, die ein Mensch liest.

09

Der Fix

Die Architektur, die daraus folgt.

ErfassenLesende Anbindung an die Systeme, in denen die Fakten schon liegen – mit Herkunft, niemals von Hand kopiert
SpeichernDatensätze in der Datenbank · Dokumente als Dateien · Belege unveränderlich im Objektspeicher
IndizierenSuche und Embeddings, aus den Speichern neu erzeugbar – ein Index, nie eine Quelle
ProzedurenBenannte, versionierte Abläufe. Deterministische Schritte laufen als Code, Urteilsschritte werden zur Freigabe vorgelegt
AgentenLesen das Gedächtnis, führen Prozeduren aus, erstellen Entwürfe – schreiben nie einen Datensatz ohne Freigabe
NachweisJede Antwort mit Quelle, Datum und Aktualität · Widersprüche werden gezeigt · jede Freigabe protokolliert
MenschFreigabe an jedem Punkt, an dem etwas das Haus verlässt

Das Werkzeug an der Agentenschicht ist austauschbar – Manus, Hermes, Codex, was 2027 kommt. Datenmodell, Prozeduren und Nachweiskette sind der Teil, der Ihnen gehört.

10

Vier Tests statt eines vagen Kriteriums

So macht man „arbeitet“ überprüfbar.

TestVorgehenBestanden bei
Auffinden20 echte Fragen, die das Unternehmen im letzten Quartal hatte≥ 80 % korrekt mit belegbarer Quelle
AktualitätKeine Antwort darf eine überholte Quelle unmarkiert zitieren0 von 20 stillen Altfällen
ReproduzierbarkeitZwei Personen führen dieselbe Prozedur unabhängig ausgleiches Ergebnis
ZeitEine benannte wiederkehrende Aufgabe, Stunden vorher und nachher gemessen≥ 50 % Reduktion

Vier Zahlen. Fällt eine davon aus, wissen Sie, was zu korrigieren ist. Das aktuelle Kriterium ist eine Hoffnung mit Datum.

11

Die 12 Wochen, neu sortiert

Der Anwendungsfall gehört in Woche 1, nicht in Woche 5.

WocheAktuell geplantVorschlag
1Technologie verstehenEinen wiederkehrenden, schmerzhaften, messbaren Prozess wählen – und ihn heute messen (Stunden, Fehlerquote, wer sich beschwert)
2–3Probleme untersuchenNur die Datensätze modellieren, die dieser Prozess braucht. Nur diese Quellen anbinden
4–6Zielgruppen eingrenzenProzedur schreiben, deterministische Schritte automatisieren, Rest als Entwurf
7–9Anwendungsfälle bauenIm Echtbetrieb laufen lassen, gegen die Messung aus Woche 1 vergleichen
10–12Markt validieren, dokumentierenEinen zweiten Prozess auf derselben Datenschicht bauen

Und der eigentliche Produkttest ist nicht „jemand kann es nachlesen“ – das beweist nur gute Dokumentation. Der Test ist: der zweite Anwendungsfall kostet einen Bruchteil des ersten, weil Datenschicht, Prozedurformat und Nachweiskette schon existieren. Das ist der Unterschied zwischen Projektgeschäft und einem Produkt, das Sie sechsmal verkaufen.

Anwendungsfall 1

GEO-Monitoring

Messen, ob die Kunden Ihrer Kunden von ChatGPT, Gemini und Perplexity empfohlen werden – und beweisen, dass Ihre Arbeit daran etwas verändert.

Kein neues Marktsegment. Dieselben Kunden, die heute SEO bei Ihnen einkaufen.

13

Warum jemand dafür zahlt

Der Schmerz ist nicht das fehlende Dashboard.

Jeden Monat muss die Agentur belegen, dass ihre GEO-Arbeit in den KI-Antworten etwas bewegt hat. Heute heißt das: eine studentische Hilfskraft kopiert Prompts in Chatfenster und macht Screenshots für Folien.

Fragt der Kunde „woher wissen Sie das?“, gibt es Screenshots ohne Methodik, ohne Wiederholungsmessung, ohne Vorher-Nachher.

6–10Stunden pro Kunde und Monat
0belastbare Nachweise
100 %nicht abrechenbar

Zahlen aus dem Agenturalltag – in Woche 1 mit der Stoppuhr zu bestätigen, genau wie Test 4 auf Folie 10 es verlangt.

14

Warum es technisch schwer ist

KI-Systeme antworten nicht zweimal gleich.

Dieselbe Frage dreimal gestellt: die Marke wird zweimal genannt und einmal nicht. Wer einmal pro Woche misst, kann nicht unterscheiden zwischen „wir haben Sichtbarkeit verloren“ und „das Modell hat heute anders gewürfelt“.

Die meisten Anbieter in diesem Markt ignorieren das und zeichnen ein Liniendiagramm zufälliger Schwankung. Beim Kunden erzeugt das jede Woche Scheinergebnisse – und in Woche drei ist das Vertrauen weg.

Das ist keine Randnotiz. Das ist das Problem, um das das ganze Produkt gebaut ist.

15

Die Antwort darauf

Jede Frage mehrfach stellen – und die Unsicherheit mitliefern.

Zwei von drei Antworten nennen die Marke. Das ergibt nicht „67 %“, sondern diesen Bereich:

0 %
25
50
75
100 %

Schätzwert 66,7 % · plausibler Bereich 20,8 – 93,9 % · n = 3

Mehrfachmessung

Jeder Prompt wird pro Engine dreimal gestellt. Erst dann lässt sich Bewegung von Zufall trennen.

Statistischer Test

Jede Veränderung wird geprüft und für die Anzahl der Vergleiche korrigiert. 60 Prompts × 3 Engines ergeben 180 Vergleiche pro Woche – ohne Korrektur sehen davon rund 9 jede Woche wie Erfolge aus, rein zufällig.

Ehrliche Darstellung

Nicht belegbare Bewegung wird grau als „innerhalb der normalen Schwankung“ ausgegeben. Farbe ist belegten Veränderungen vorbehalten.

16

Stand heute

Die Maschine läuft. Nicht als Konzept.

5.600Zeilen Python
124Tests, alle grün
4Engines angebunden
0 €Kosten für die Demo

Fertig und getestet

  • Kundenkonfiguration mit Schutz gegen Falschtreffer („Helios Kliniken“ ist nicht der Kunde)
  • Kostenschätzung vor jedem Lauf, hartes Ausgabenlimit, Wiederaufnahme ohne Doppelabrechnung
  • Unveränderliche Speicherung jeder Roh-Antwort mit Integritätsprüfung
  • Erkennung von Marken und Wettbewerbern, Quellen-Zuordnung nach Eigentümer
  • Vertrauensintervalle, Signifikanztests, Korrektur für Mehrfachvergleiche
  • Wochenreport als Markdown und druckfertiges HTML, eingefroren mit Prüfsumme

Noch offen, bewusst

  • Datenbank und Mehrmandantenfähigkeit – heute eine Datei pro Kunde
  • Sprachmodell für „Empfehlung oder nur Nennung?“ – braucht einen von Menschen geprüften Referenzsatz
  • Monatsreport, Zeitsteuerung, Weboberfläche
  • Die drei Live-Anbindungen sind gegen die Dokumentation gebaut, aber noch nicht gegen die echten Schnittstellen geprüft – dafür gibt es einen Befehl, der genau einen Aufruf macht
17

Demonstration · fiktiver Kunde

Demo-Daten – erfundenes Unternehmen

So sieht eine Messung aus.

KennzahlVorperiodeDiese PeriodeVeränderungStatistisches Urteil
Nennungsquote33,3 % (KI 24,5–43,6)53,3 % (KI 43,1–63,3)+20,0 ppbelegte Zunahme (q = 0,0068)
Nennungsquote gewichtet32,1 % (KI 25,5–39,5)54,2 % (KI 46,6–61,5)+22,0 ppbelegte Zunahme
Eigene Website zitiert15,6 % (KI 9,5–24,4)23,3 % (KI 15,8–33,1)+7,8 ppinnerhalb der normalen Schwankung
Prompts mit Nennung18 von 3028 von 30Anzahl, keine Quote
Prompts mit stabiler Präsenz10 von 3017 von 30die belastbare Position

Zeile 3 ist der Punkt. Die Zahl ist gestiegen – und der Report sagt trotzdem, dass sie nicht belegbar ist. Diese Bereitschaft, „das ist Rauschen“ zu sagen, ist das Verkaufsargument. Sie ist der Unterschied zu allen Anbietern, die jede Bewegung als Erfolg verkaufen.

18

Nachweiskette

Jede Zahl führt zur Roh-Antwort zurück.

PromptExakter Wortlaut, Version, Prüfsumme – unveränderlich, sobald er gelaufen ist
ModellNicht das angefragte, sondern das vom Anbieter tatsächlich gemeldete Modell
ZeitpunktZeitstempel, Sprache, Land, welche Wiederholung
AntwortVollständige Roh-Antwort des Anbieters, gespeichert unter dem Hash ihres eigenen Inhalts
AuswertungErkannte Marken mit Zeichenposition, zitierte Quellen mit Eigentümer – versioniert, nie überschrieben
ReportEingefroren mit Prüfsumme. Eine Neuberechnung morgen kann nicht ändern, was gestern verschickt wurde

Das gemeldete Modell ist die wichtigste einzelne Zeile. Anbieter wechseln Modellversionen unangekündigt. Wer das nicht mitschreibt, verkauft dem Kunden irgendwann einen Modellwechsel als eigenen Erfolg – und wird damit erwischt.

19

Zu Manus und Agenten

Agenten sind hervorragend beim ersten Mal und untauglich beim tausendsten.

Was die Aufgabe verlangtWas ein Agent tut
Immer exakt denselben Prompt sendenformuliert um, „verbessert“ die Frage
Festhalten, welche Modellversion geantwortet hatkommt nicht darauf
Dasselbe Intervall für immer gleich berechnenleitet es jedes Mal neu her
Bei Wiederholung nicht doppelt abrechnenkennt kein Idempotenz-Konzept
In sechs Monaten belegen, woher eine Zahl kamkein gespeicherter Verlauf

Jede Anforderung lautet „improvisiere nicht“ – und Improvisation ist die Kernfunktion eines Agenten. Dazu: ein Agentenlauf kostet ein Vielfaches eines einzelnen Aufrufs, bei etwa 2.150 Messungen pro Kunde und Monat.

Dafür sind Agenten richtig

Einmalige Recherche („warum gewinnt Vaillant dieses Thema?“) · Faktenblatt aus einer Website erstellen · erste Promptbibliothek einer neuen Branche entwerfen · Ihre eigene Neukundenrecherche · Fragen an die gespeicherten Daten stellen

Dafür nicht

Alles, was jede Woche identisch laufen und danach beweisbar sein muss. Genau dieser Teil steht auf der Rechnung.

Sprachmodelle kommen sehr wohl vor – als einzelne Aufrufe mit festem Schema, versioniert und gegen einen von Menschen geprüften Referenzsatz gemessen. Die Grenze verläuft nicht zwischen KI und nicht-KI, sondern zwischen Improvisation und festgelegtem Ablauf.

20

Technische Entscheidungen

Eine Datenbank. Der Rest kommt, wenn ein Problem gemessen ist.

FrageEntscheidungBegründung
DatenhaltungPostgreSQLJede Frage ist eine Zählfrage mit bekannter Form. Genau dafür ist eine relationale Datenbank gebaut
GraphdatenbankneinKein Pfad unbekannter Länge wird abgefragt. Erst wenn eine konkrete Abfrage aufgeschrieben ist, die Postgres nachweislich nicht kann
Vektordatenbankspäter, als Erweiterungpgvector in derselben Datenbank. Ein Index ist wegwerfbar – deshalb ist er nie die Quelle
Obsidianfür Notizen, nicht als QuelleKein Mehrbenutzerbetrieb, keine Rechte, keine Protokollierung. Für Playbooks Ihrer Berater völlig in Ordnung
AblaufsteuerungPythonStatistik muss testbar sein, Mandantentrennung erzwingbar. In einem Klickdiagramm ist beides nicht möglich
n8nnur am RandDarf Benachrichtigungen nach Slack oder CRM schicken. Nie rechnen, was im Report steht

Und die eine Zeile, die die Vektor-Frage entscheidet: den Index kann ich löschen und in zehn Minuten neu bauen. Die Datenbank nicht.

21

Kosten

Annahmen – in Woche 1 durch Messung zu ersetzen

Rund 78 € pro Kunde und Monat, und es skaliert kaum.

KundenKI-KostenInfrastrukturGesamt / MonatPro Kunde
5390 $170 $560 $112 $
251.950 $510 $2.460 $98 $
1007.800 $1.595 $9.395 $94 $

Die unbequeme Erkenntnis

Rund vier Fünftel der Kosten sind variabel pro Kunde. Von 5 auf 100 Kunden sinken die Kosten je Kunde nur von 112 auf 94 $. Das ist kein klassisches Softwaregeschäft.

Der Hebel

Prompts × Engines × Wiederholungen × Takt. Eine kleine Stufe kostet etwa 22 $ im Monat, die vollständige etwa 78 $. Diese Staffelung muss von Anfang an im Produkt sein – sie ist der Preishebel, kein Feature.

22

Was das für Ihr Portfolio bedeutet

Der Anwendungsfall liefert genau das, was dem Retainer fehlt.

Ihre Rechnung: sechs Kunden × 3.000 € × 12 Monate = 216.000 € wiederkehrend. Die offene Frage war, was monatlich ankommt.

Hier ist die Antwort: jede Woche ein Report, jeden Monat ein Nachweis, dass die Arbeit die Zahl bewegt hat – oder eben nicht. Bei Kosten von rund 78 € je Kunde und Monat.

Zusätzlich ist GEO-Monitoring selbst ein Unternehmensgedächtnis: jeder Prompt, jede KI-Antwort, jede Maßnahme, jedes Ergebnis – gespeichert, abfragbar, belegbar.

Und der Teil, der Ihre Agenten stärker macht

Ein lesender Zugang, über den Manus oder Hermes diese Daten abfragen können. Dann fragt Ihr Agent: „welcher meiner Kunden hat diesen Monat Sichtbarkeit verloren, und was haben die verlorenen Antworten gemeinsam?“ – und bekommt eine echte Antwort mit Quellen.

Das Gedächtnis, das Ihren Agenten bisher gefehlt hat. Ihre These, nur der Teil davon, der trägt.

23

Vorschlag

Was ich vorschlage, für die nächsten zwei Wochen.

Diese WocheMessexperiment: 20 echte Prompts, 3 Engines, 10 Wiederholungen, zweimal im Abstand von drei Tagen. Kosten unter 30 $. Ergebnis: wie stark die Antworten schwanken, was ein Lauf wirklich kostet, ob ein Wochentakt überhaupt vertretbar ist
ParallelZwei Stunden mit einem Ihrer Berater: den aktuellen Reportingprozess Schritt für Schritt mit der Stoppuhr messen. Das ist die Basislinie für Test 4
ParallelZwei Fragen an den Anwalt: Auftragsverarbeiter-Kette zu den KI-Anbietern, und die Datenquelle für Google-KI-Übersichten
Woche 2Ein echter Pilotkunde konfiguriert, erster Lauf, erster Report mit echten Zahlen
Ihre EntscheidungLizenz, gemeinsame Entwicklung oder White-Label – die drei Varianten haben unterschiedliche Konsequenzen, und diese Frage sollten wir vor der Pilotphase klären
Die Software ist eine Woche Arbeit. Die zwölf Wochen sind es nur wert, wenn sie etwas ansammeln, das ein Wettbewerber nicht kaufen kann: echte Kundendaten, gemessene Genauigkeit und den Beweis, dass Ihre Arbeit die Zahl bewegt.

Deshalb zuerst das Experiment und nicht der Code. Fünf der wichtigsten Annahmen in dieser Präsentation sind heute Schätzungen. Bis Freitag könnten es Messwerte sein.