SPOKE

Sichtbarkeit in ChatGPT messen

So messen Sie Ihre Sichtbarkeit in ChatGPT systematisch. Manuelle Verfahren, Tools und ein 4-KPI-Framework fuer Mittelstand.

Autor: Thomas Weber, FounderStand: 2026-06-181700 Wörter

Sichtbarkeit in ChatGPT messen

Die Sichtbarkeit in ChatGPT zu messen bedeutet, systematisch zu erfassen, wie oft, in welchem Kontext und mit welcher Tonalitaet das Sprachmodell das eigene Unternehmen auf relevante Nutzeranfragen hin empfiehlt. Wer diese Daten kontinuierlich erhebt, verfuegt ueber die Basis, um Massnahmen im Bereich ChatGPT SEO fundiert auszusteuern und nachvollziehbar zu belegen.

Zusammenfassung

  • Manuelle Messung reicht fuer den Start: Ein festes Set von 20 bis 50 Prompts genuegt, um erste Baselines zu schaffen.
  • Tools automatisieren Skalierung: Plattformen wie Profound, Peec AI oder Otterly nehmen Ihnen die wiederkehrende Erhebung ab.
  • Eigenentwicklungen lohnen sich: Fuer maximale Kontrolle liefert die Anbindung an die OpenAI API strukturierte, kostenguenstige Ergebnisse.
  • Vier Kern-KPIs: Messen Sie Mention-Rate, Share of Voice, Sentiment und Quellen-Rate, um den Erfolg greifbar zu machen.
  • Frequenz entscheidet: Operative Teams brauchen woechentliche Daten, das Management verlangt nach konsolidierten Quartalsberichten.

Inhaltsverzeichnis

Warum muessen wir die ChatGPT-Sichtbarkeit isoliert betrachten?

Die Analyse klassischer Suchmaschinen liefert keine zuverlaessigen Aussagen darueber, wie generative KI-Modelle antworten. Waehrend Google auf externen Links und Onpage-Signalen aufbaut, generieren Large Language Models (LLMs) ihre Antworten auf Basis semantischer Wahrscheinlichkeiten und Trainingsdaten. Dies bringt ein voellig neues Mess-Paradigma mit sich.

Ein Hersteller von Industriearmaturen mag bei klassischen Suchen auf Platz eins rangieren. Das bedeutet aber nicht, dass ChatGPT das Unternehmen bei der Anfrage "Welche Ventile eignen sich fur korrosive Chemikalien im Anlagenbau?" ueberhaupt erwaehnt. Solange Sie diese Diskrepanz nicht beziffern, optimieren Sie im Blindflug. Eine strategisch geplante KI-Sichtbarkeit fuer den Mittelstand setzt exakte Messverfahren voraus, die speziell auf die Architektur von Antwort-Engines zugeschnitten sind. Die Herausforderung besteht darin, den fluchtigen Charakter von KI-Antworten in strukturierte, wiederholbare Datensaetze zu uebersetzen.

Wie funktioniert der manuelle Workflow fuer Einsteiger?

Wer neu in die Messung einsteigt, bendigt keine teuren Lizenzen. Ein sauber strukturierter manueller Prozess bildet das ideale Fundament, um die Eigenheiten der KI-Antworten kennenzulernen. Dieser Workflow erfordert Disziplin, liefert dafuer aber tiefe qualitative Einblicke.

Schritt 1: Prompt-Set definieren

Bauen Sie ein Set aus 20 bis 50 zielgerichteten Prompts auf. Diese Prompts spiegeln die tatsaechlichen Fragen Ihrer potenziellen B2B-Kunden wider. Trennen Sie diese in drei Kategorien:

  1. Informational: "Wie optimiere ich die Taktzeiten in der CNC-Fertigung?"
  2. Vergleichend: "Was sind die Vor- und Nachteile von Cloud-ERP-Systemen im Vergleich zu On-Premise fuer Maschinenbauer?"
  3. Transaktional: "Welche B2B-Anbieter fuer Maschinendaten-Erfassung aus Deutschland gibt es?"

Schritt 2: Saubere Testumgebung schaffen

KI-Modelle personalisieren Antworten. Um unverfaelschte Daten zu erhalten, schalten Sie die "Custom Instructions" oder den "Speicher" in ChatGPT ab. Oeffnen Sie temporaere Chats. Nutzen Sie zwingend immer das exakt selbe Modell, um vergleichbare Ergebnisse zu garantieren. Ein Wechsel zwischen "GPT-4o" und "GPT-4" ruiniert die Zeitreihe.

Schritt 3: Tabellen-Tracking und Auswertung

Legen Sie eine systematische Tabelle an. Die Spalten umfassen: Datum, Prompt, Modell-Version, Nennung der eigenen Marke (Ja/Nein), Platzierung in der Aufzaehlung (z.B. Platz 2 von 5 empfohlenden Tools), Sentiment (Positiv, Neutral, Negativ) und Nennung der direkten Konkurrenten. Fuhren Sie diese Stichprobe konsequent jeden Montag durch.

Nach wenigen Wochen erkennen Sie erste Muster. Sie sehen, bei welchen Fragen Ihr Wettbewerb dominiert und bei welchen Use-Cases ChatGPT Ihre Loesung praeferiert. Dieser handgemachte Ansatz stiesst jedoch ab etwa 100 Prompts an seine Grenzen.

Welche Tools automatisieren das Tracking im Alltag?

Sobald das Prompt-Set waechst oder Sie unterschiedliche regionale Maerkte abdecken muessen, wird die manuelle Erhebung unwirtschaftlich. Marktuebliche Softwareloesungen schaffen hier Abhilfe. Sie uebernehmen die repetitiven Abfragen, bereinigen die Daten und stellen Dashboards bereit. Einen detaillierten LLM Monitoring Tools Vergleich finden Sie hier in reduzierter Form zusammengefasst.

Profound Profound fokussiert sich auf grossflachiges B2B-Tracking und eignet sich hervorragend fuer Unternehmen, die tiefgehende Attributionsdaten benoetigen. Das Tool zeigt nicht nur auf, ob Sie genannt werden, sondern versucht zu rekonstruieren, aus welchen Webquellen das Modell diese Information bezogen hat.

Peec AI Dieses Tool richtet sich stark an SaaS-Anbieter und Digitalunternehmen. Peec AI punktet mit einer klaren Benutzeroberflache und einer einfachen Einrichtung der Konkurrenz-Vergleiche. Es visualisiert den Share of Voice auf einen Blick.

Otterly und AthenaHQ Beide Loesungen positionieren sich als agiles Radar fur die Tonalitaet und Nennungshaeufigkeit in verschiedenen KI-Modellen. AthenaHQ gewinnt vor allem im Agenturbereich an Beliebtheit, da es White-Label-Reports zulaesst und Mandanten-Ansichten bietet.

Goodie Als schlanker Player am Markt liefert Goodie genau das, was kleinere Mittelstaendler brauchen: Eine einfache Eingabemaske fuer Prompts und klare Charts zur Sichtbarkeitsentwicklung ohne komplexe Einrichtungsschritte.

Platzhische: Conductor und Semrush AI Toolkit Klassische SEO-Giganten hinken dem Trend nicht hinterher. Conductor integriert zunehmend AEO-Metriken in sein Enterprise-Dashboard. Semrush bietet mit seinem AI Toolkit Erweiterungen an, die Nutzer der Plattform sofort aktivieren koennen. Der Vorteil hier liegt in der Konsolidierung: Sie sehen klassische Suchdaten und KI-Daten in einem Interface.

Wie bauen Sie ein eigenes Mess-Skript via OpenAI API?

Wennfertige Tools Ihre spezifischen Anforderungen nicht erfuellen, bietet die Eigenentwicklung via Schnittstelle (API) den hoechsten Grad an Kontrolle. Da OpenAI den API-Zugang transparent abrechnet, bleiben die Kosten pro Abfrage im Cent-Bereich. Dies erlaubt das Tracking von Tausenden Prompts.

Der typische Aufbau eines solchen Python-Skripts sieht vor, dass das Programm Ihre Prompts aus einer Datenbank ausliest. Es sendet diese anschliessend an die API. Hier greift ein entscheidender technischer Kniff: Setzen Sie den Parameter "Temperature" im API-Call auf den Wert 0. Die Temperature steuert die Kreativitaet des Modells. Ein Wert von 0 zwingt das Modell dazu, moeglichst deterministisch und sachlich zu antworten. Das reduziert Halluzinationen und macht die Messung zuverlassiger.

Sobald die Antwort vorliegt, muss das Skript diese auswerten. Dafuer hat sich die Methode "LLM-as-a-judge" bewaehrt. Sie nutzen ein guenstiges, schnelles Modell, um den Text zu analysieren. Sie senden die erzeugte Antwort an das Analyse-Modell und fragen: "Befindet sich in diesem Text der Markenname X? Antworte nur mit JA oder NEIN."

Diese Methodik umgeht das Problem fehlerhafter Such-Skripte. Ein reiner Word-Match (Strg+F) scheitert oft an Deklinationen oder Bindestrichen im Text. Das Analyse-Modell versteht den Kontext und filtert zuverlassig Fehler aus. Das fertige Ergebnis fliesst dann automatisch in Ihr Data Warehouse oder ein Looker Studio Dashboard.

Welche vier KPIs definieren den Mess-Erfolg?

Sichtbarkeit ist kein abstrakter Wert. Sie laesst sich in vier konkrete Metriken zerlegen. Diese Struktur hilft dabei, Budgets gegenueber der Geschaftsfuhrung zu rechtfertigen und Brand Mentions verlaesslich in LLMs zu tracken.

1. Mention-Rate (Brand Mentions)

Diese Kennzahl beantwortet die Grundfrage: Kommen wir im relevanten Kontext vor? Sie setzen die Anzahl der positiven Nennungen ins Verhaeltnis zu allen beobachteten Prompts. Wer bei 100 Test-Prompts genau 20 Mal von ChatGPT als Loesungsanbieter genannt wird, erzielt eine Mention-Rate von 20 Prozent.

2. Share of Voice (SoV)

Der SoV setzt Ihre Erwaehnungen in direkte Relation zu Ihren Hauptkonkurrenten. Wenn ChatGPT bei Anfragen zu "Lagerhaltungs-Software" zehn verschiedene Anbieter ausspuckt, und Sie nehmen davon regelmassig zwei Plaetze in der Aufzaehlung ein, betragt Ihr relativer Anteil 20 Prozent in dieser Nische. Weitere Details zur strategischen Berechnung finden Sie hier: GEO KPIs und Share of Voice.

3. Sentiment-Score

Die blosse Nennung bedeutet keinen geschftlichen Erfolg, wenn das Modell davor warnt, Ihre Software sei fehleranfallig oder zu teuer. Bewerten Sie Nennungen auf einer Skala (z.B. +1 fuer positive Empfehlung, 0 fuer neutrale Listung, -1 fur Kritik). Ein durchschnittlich positiver Score beweist, dass das Modell Ihre Marke mit fachlicher Qualitaet verbindet.

4. Quellen-Rate (Citation Rate)

Insbesondere bei der Nutzung von "SearchGPT" oder Modellen mit direktem Webzugriff verlinkt die KI oft direkt auf Quellen. Die Quellen-Rate erfasst, in wie viel Prozent der Erwaehnungen ein direkter, klickbarer Link auf Ihre Domain platziert wurde. Das verschiebt die Messung vom reinen Branding hin zu direktem Referral-Traffic.

Die folgende Ubersicht verdichtet diese vier Metriken fuer Ihren schnellen Ueberblick:

KPI Berechnungs-Formel Typische Zielwert-Bandbreite (B2B)
Mention-Rate (Anzahl der Nennungen / Gesamtanzahl Prompts) * 100 15 % - 35 % im direkten Kompetenzbereich
Share of Voice (Eigene Nennungen / Alle Nennungen inkl. Wettbewerb) * 100 10 % - 25 % je nach Marktsituation
Sentiment-Score Summe positiver Nennungen - Summe negativer Nennungen > 80 % neutrale bis positive Tonalitaeten
Quellen-Rate (Nennungen mit URL / Alle Nennungen) * 100 5 % - 15 % bei transaktionalen Anfragen

Wie oft gehoert das Reporting auf den Tisch?

Ein Tracking nützt wenig, wenn es im Silo verharrt. Die dynamische Natur von KI-Modellen erfordert unterschiedliche Rhythmen fuer unterschiedliche Zielgruppen im Unternehmen.

Das operative Marketingteam schaut im Idealfall wochentlich auf die Daten. Ein grosses Sprachmodell-Update seitens OpenAI kann Rankings von heute auf morgen signifikant verschieben. Das Team muss sofort erkennen, wenn wichtige Informations-Prompts ploetzlich Wettbewerber statt der eigenen Loesung empfehlen. Diese Frequenz schuetzt vor unbemerkten Einbruechen.

Für Marketingleiter oder CMOs empfiehlt sich ein monatlicher Rhythmus. Hier stehen nicht Einzel-Prompts im Vordergrund, sondern der aggregierte Share of Voice. Der CMO pruft, ob laufende PR-Kampagnen oder veroffentlichte Case Studies bereits Niederschlag in den Trainingsdaten oder abgerufenen RAG-Prozessen (Retrieval-Augmented Generation) der KI finden.

Die Geschaeftsfuhrung oder das C-Level erhalt die Ergebnisse auf Quartalsbasis. In diesem aggregierten Report verknuepfen Sie die generative Sichtbarkeit mit den nackten Geschaftszahlen. Steigen die Inbound-Leads in Segmenten, in denen die ChatGPT-Sichtbarkeit stark angestiegen ist? Solche Korrelationen untermauern den Return on Invest der neu geschaffenen Strukturen und sichern Folgebudgets.

FAQ

Kann ich die Google Search Console fuer ChatGPT nutzen?

Nein, die Google Search Console erfasst ausschliesslich den Traffic aus der Google Suche und Google Discover. Zwar laesst sich Traffic von ChatGPT in Analytics-Tools eidentifizieren, wenn Links geklickt werden, aber reine Sichtbarkeit (Nennungen ohne Klicks) erfassen diese Tools grundsatzlich nicht.

Verfaelschen meine eigenen Chats die Ergebnisse?

Ja. Wenn Sie an Ihrem eigenen Arbeitsrechner staendig ueber Ihr Unternehmen chatten, merkt sich die KI Ihre Praeferenzen, sofern Memory-Funktionen aktiv sind. Messungen mussen immer in einer neutralen Umgebung ohne Historie stattfinden.

Wie unterscheidet sich ChatGPT Plus von der Free-Version bei der Messung?

ChatGPT Plus (mit kostenpflichtigem Zugang) nutzt potenziell neuere Modelle wie GPT-4o mit uneingeschraenktem Webzugriff, wahrend Free-Nutzer oft Restriktionen unterliegen. B2B-Kunden nutzen typischerweise die bezahlten Versionen. Messen Sie primar in der Premium-Infrastruktur.

Warum fallen meine Rankings in ChatGPT plotzlich ab?

Solche Drops resultieren meist aus zwei Ursachen. Entweder OpenAI hat das zugrunde liegende Modell aktualisiert und gewichtet Quellen neu, oder Konkurrenten haben massiv in digitale PR und Fachpublikationen investiert, welche die KI besser auslesen konnte.

Was kostet ein professionelles LLM-Tracking?

Die Kosten variieren massiv. Ein manuelles Tracking kostet lediglich Arbeitszeit. SaaS-Tools fur professionelles B2B-Tracking starten meist bei 200 bis 500 Euro pro Monat. Ein eigens gebautes API-Skript erfordert Entwicklungskosten, liegt im laufenden API-Verbrauch jedoch oft unter 50 Euro pro Monat.