AI Citations und Brand Mentions: Wie wir KI-Sichtbarkeit im B2B wirklich messen und verbessern

Matthias Eggert Geschäftsführer DIXENO GmbH

Ein Einkäufer fragt ein KI-System: „Welcher Anbieter hilft mir bei der Auswahl eines Ersatzteils für eine industrielle Förderpumpe?“ Die Antwort nennt Ihren Shop, verlinkt aber einen Vergleichsartikel auf einer fremden Website. Bei der nächsten Frage erscheint Ihre technische Anleitung als Quelle – Ihr Unternehmen wird jedoch nicht genannt. Beides ist Sichtbarkeit. Für Ihr Geschäft sind es zwei unterschiedliche Ausgangslagen.

Unsere wichtigste Regel bei DIXENO: Wir zählen nicht bloß Erwähnungen. Wir prüfen, ob eine Marke im Antworttext vorkommt, welche URL als Quelle erscheint, wie das Unternehmen eingeordnet wird und ob daraus relevante Besuche oder Anfragen entstehen. Für B2B-Shops mit langen Entscheidungswegen ist diese Trennung wichtiger als jede pauschale „KI-Sichtbarkeitsquote“.

Eine Brand Mention ist die Nennung einer Marke oder eines Produkts im generierten Antworttext. Eine AI Citation ist ein vom System als Quelle angezeigter Verweis auf eine URL. Eine Empfehlung geht weiter: Die Antwort nennt das Unternehmen als passende Option für den beschriebenen Bedarf. Diese drei Beobachtungen gehören in getrennte Felder Ihres Audits. Ein verlinkter Fachartikel auf Ihrer Domain kann ohne Markennennung erscheinen; umgekehrt kann Ihre Marke genannt werden, während ein Händlerverzeichnis verlinkt wird.

Wir prüfen außerdem den Kontext. „Anbieter X ist geeignet, wenn Sie Baureihe Y benötigen“ ist etwas anderes als „Anbieter X liefert Baureihe Y nicht“. Eine negativ oder falsch formulierte Mention lässt sich nicht durch höhere Mention-Zahlen schönrechnen. Und eine Citation zeigt zunächst nur, dass die Oberfläche einen Link ausweist: Sie beweist weder eine fachlich richtige Antwort noch, dass die Quelle jede Aussage tatsächlich stützt. Eine wissenschaftliche Untersuchung älterer generativer Suchsysteme hat genau diese Schwäche bei Quellenbelegen dokumentiert. Die dort gemessenen Fehlerquoten übertragen wir ausdrücklich nicht auf heutige Produkte.

Für die Bewertung unterscheiden wir deshalb vier Fälle: Marke und eigene URL sichtbar; Marke sichtbar, aber nur fremde URLs zitiert; eigene URL zitiert, Marke nicht genannt; beides fehlt. Hinzu kommen zwei eigene Qualitätsmerkmale: War die Aussage korrekt, und war sie für eine reale Kauf- oder Beratungsentscheidung hilfreich? Das ist unsere Arbeitslogik, kein Rankingfaktor, den ein KI-Anbieter bestätigt hätte.

Warum SEO die Voraussetzung bleibt – und wo es allein nicht reicht

Google beschreibt für AI Overviews und AI Mode dieselben technischen Grundlagen wie für seine Suche: Eine Seite muss indexiert sein und für die Anzeige mit Snippet infrage kommen, damit sie als unterstützender Link erscheinen kann. Lesbarer Hauptinhalt, crawlbare interne Links und zugängliche Seiten bleiben relevant. Google kann für eine Antwort mehrere verwandte Suchen auslösen („Query Fan-out“); die sichtbaren Quellen müssen deshalb nicht exakt auf den Wortlaut der Ausgangsfrage optimiert sein. Sichtbarkeit wird damit wahrscheinlicher, aber nie garantiert.

Bei einem B2B-Shop bedeutet das konkret: Eine indexierbare Kategorieseite „Industriepumpen“ ersetzt keine verständliche Antwort auf „Welche Daten benötige ich, um ein passendes Ersatzteil eindeutig zu identifizieren?“. Umgekehrt nützt selbst die beste technische Anleitung wenig, wenn ihr Canonical auf eine andere URL zeigt, entscheidende Informationen erst nach einem Login sichtbar werden oder der Crawler die Seite nicht erreicht. Unsere technischen SEO-Audits für OXID-Shops setzen genau an dieser Grundlage an.

Auf fremden Websites entsteht eine zweite Ebene: Berichten Fachmedien, Hersteller, Partner oder echte Kunden nachvollziehbar über Ihre Kompetenz, kann Ihre Marke im richtigen fachlichen Kontext auftauchen. Eine Ahrefs-Analyse von 75.000 überwiegend etablierten Marken fand starke Korrelationen zwischen öffentlichen Markenerwähnungen und Brand Mentions in KI-Antworten. Das ist kein Beweis, dass gekaufte Erwähnungen Empfehlungen auslösen. Die Stichprobe setzte unter anderem ein Domain Rating über 40 und ein Marken-Keyword mit mindestens 800 monatlichen Suchen voraus; kleine B2B-Nischen sind damit nicht automatisch repräsentiert.

Der 90-Minuten-Baseline-Audit: So finden wir die tatsächliche Lücke

Wir beginnen nicht mit hundert künstlichen „Nenne die besten Anbieter“-Prompts. Stattdessen nehmen wir 24 reale Fragen aus Vertrieb, interner Suche, Beratung und Service: acht zur Problemerkennung, acht zum Vergleich von Lösungen und acht kurz vor einer Anfrage oder Bestellung. Die Zahl 24 ist ein praktikabler Startwert für diesen Audit, keine statistische Norm. Ein anonymisiertes B2B-Beispiel:

  • Problem: „Welche Angaben braucht ein Lieferant, um eine Förderpumpen-Dichtung eindeutig zuzuordnen?“
  • Vergleich: „Was unterscheidet Originalteil und kompatibles Ersatzteil bei dieser Baureihe?“
  • Entscheidung: „Welche Unterlagen sollte ein Anbieter vor einer Ersatzteilbestellung bereitstellen?“

Wir testen jede Frage auf den für die Zielgruppe relevanten Plattformen, beispielsweise Google AI Overviews oder AI Mode, ChatGPT mit Suche und Microsoft Copilot. AI Overviews erscheinen nicht bei jeder Anfrage; „kein AI Overview“ wird daher separat notiert und nicht als „Marke nicht erwähnt“ verbucht. Pro Frage und Plattform wiederholen wir den Test zu drei dokumentierten Zeitpunkten. Bei 24 Fragen auf drei Plattformen und drei Durchläufen entstehen maximal 216 Beobachtungen – nur dort, wo die jeweilige Funktion tatsächlich eine Antwort erzeugt. Wir halten Land, Sprache, angemeldeten oder unangemeldeten Zustand, verwendeten Modus und Datum konstant oder dokumentieren jede Abweichung. Die Wiederholung dämpft Zufall, ersetzt aber keine repräsentative Studie. Untersuchungen zu wiederholten KI-Abfragen zeigen, dass Quellen und Zitierhäufigkeiten schwanken können.

Für jede einzelne Antwort speichern wir den vollständigen Prompt und die Antwort, einen Screenshot, die wörtliche Markennennung, den Antwortkontext, die exakte Ziel-URL jeder Citation sowie die sichtbare Empfehlung oder Einschränkung. Wichtig ist die Domain der Quelle: „Unsere Marke erwähnt, aber fremde Domain zitiert“ ist ein anderer Befund als „unsere Produktseite zitiert“. Wir prüfen die verlinkte Seite stichprobenartig gegen die konkrete Behauptung. Wenn eine Antwort technisch falsche Kompatibilität behauptet, priorisieren wir die Korrektur vor jeder Reichweitenoptimierung.

Die vier Kennzahlen für den Start definieren wir pro Plattform und Fragengruppe mit demselben Nenner – den tatsächlich ausgewerteten Antworten:

  1. Mention-Rate: Antworten mit korrekter Nennung unserer Marke ÷ ausgewertete Antworten.
  2. Eigene-Citation-Rate: Antworten mit mindestens einem Link auf unsere Domain ÷ ausgewertete Antworten. Eine Antwort mit drei eigenen Links zählt hier einmal; URL-Häufigkeiten erfassen wir zusätzlich.
  3. Empfehlungsrate: Antworten, in denen unsere Marke für das beschriebene Problem ausdrücklich als passende Option genannt wird ÷ ausgewertete Antworten. Neutrale Nennungen zählen nicht.
  4. Fehlzuordnungsrate: Antworten mit sachlich falschen Angaben zu unserem Angebot ÷ Antworten, in denen unsere Marke vorkommt. Wenn der Nenner null ist, weisen wir keine Rate aus.

Damit werden 30 neutrale Nennungen nicht als 30 Empfehlungen verkauft. Ebenso vermischen wir Google-Impressionen nicht mit manuell getesteten Antworten; beide stammen aus verschiedenen Grundgesamtheiten. Unser Audit ist ein Trend- und Diagnoseinstrument für definierte Fragen, keine Schätzung des gesamten Marktanteils in allen KI-Anfragen.

Was Search Console, Bing und Webanalyse 2026 tatsächlich zeigen

Google Search Console: Seit dem weltweiten Rollout vom 31. August 2026 bietet Google einen separaten Bericht „Generative AI performance“ für AI Overviews und AI Mode. Er zeigt Impressionen und unter anderem Seiten, Länder, Geräte und Zeiträume. Er zeigt nach Googles aktueller Dokumentation keine separate Klickzahl und keine Prompt- oder Mention-Liste. Fehlt der Bericht, kann die Website zu wenige Impressionen haben oder von generativen KI-Funktionen ausgeschlossen sein. Die dort ausgewiesenen Impressionen sind im allgemeinen Web-Leistungsbericht enthalten und dürfen nicht noch einmal als zusätzliche Reichweite addiert werden.

Ein Punkt, den wir in jedem Audit prüfen: In Search Console gibt es unter Einstellungen → Search generative AI einen eigenen Include-/Exclude-Schalter. „Include“ ist laut Google die Voreinstellung. „Exclude“ verhindert die Verwendung und Verlinkung eigener Inhalte in den betroffenen generativen Suchfunktionen; laut Google ist diese Wahl kein Ranking-Signal für andere Bereiche der klassischen Suche. Den tatsächlichen Status einer konkreten Property können wir ohne Zugriff nicht behaupten.

Bing Webmaster Tools: Der Bericht „AI Performance“ befindet sich in einer öffentlichen Vorschau. Microsoft zeigt die Zahl angezeigter Citations, zitierte URLs und eine Stichprobe von „Grounding Queries“. Das sind keine vollständigen Nutzerprompts; die Citation-Zahlen sagen nach Microsofts eigener Beschreibung nichts über Position, Bedeutung oder Autorität einer URL in einer Antwort aus. Der Bericht betrifft unterstützte Microsoft-Oberflächen, nicht alle KI-Systeme.

ChatGPT und Analytics: OpenAI trennt den OAI-SearchBot für ChatGPT-Suche vom GPTBot für mögliches Modelltraining. Wer OAI-SearchBot sperrt, verhindert nach OpenAIs Dokumentation in der Regel das Erscheinen als Quelle in ChatGPT-Suchantworten; Navigationslinks können eine Ausnahme sein. OpenAI beschreibt außerdem utm_source=chatgpt.com in Referral-URLs aus ChatGPT-Suchergebnissen. In GA4 prüfen wir solche Besuche deshalb zusätzlich zu erkannten Referrern und verbinden sie – soweit Tracking und Einwilligung es erlauben – mit Kontaktanfragen und CRM-Qualität. Weder eine Mention noch eine Google-KI-Impression ist bereits ein Lead.

Aus Befunden werden Maßnahmen: ein fiktiver B2B-Shop als Beispiel

Nehmen wir einen fiktiven, nicht identifizierbaren Shop für industrielle Pumpenersatzteile. Er verkauft viele Varianten, erhält aber nur wenige qualifizierte Anfragen für komplexe Ersatzteilfälle. In unserem Test wird seine Marke bei Vergleichsfragen gelegentlich genannt; als Beleg erscheint überwiegend ein Branchenportal. Bei konkreten Fragen zur Zuordnung eines Teils taucht eine allgemeine Produktkategorie auf, aber kein zitierfähiger Kompatibilitätsnachweis des Shops. Diese Beobachtungen sind ein illustratives Szenario, keine DIXENO-Kundenmessung.

Unser erster Schritt ist kein neuer Werbetext. Wir prüfen die angezeigten Quellen: Welche Teilfrage beantworten sie, die der Shop offenlässt? Angenommen, das Portal nennt die benötigten Angaben zur Identifikation, während die eigene Produktseite nur Artikelnummer und Preis führt. Dann bauen wir eine redaktionell geprüfte Informationsseite mit einer nachvollziehbaren Zuordnungslogik: benötigte Typenschildangaben, Baureihe, Ausführung, Maße, Dokumentenstand und klare Grenzen der Aussage. Wo eine Kompatibilität nicht sicher ist, steht ausdrücklich „technisch prüfen lassen“ statt einer erfundenen Freigabe. Von Kategorie und passenden Produktseiten verlinken wir auf diese Anleitung; von der Anleitung führen wir zu Datenblatt, Produkt und technischer Anfrage.

Danach arbeiten wir an der externen Belegkette. Eine Herstellerinformation, ein echter Fachbeitrag oder eine dokumentierte Branchenkooperation kann erläutern, warum der Shop bei genau diesem Problem ein kompetenter Ansprechpartner ist. Wir kaufen keine künstlichen „Top-Anbieter“-Listen und streuen den Markennamen nicht in irrelevanten Foren. Das würde weder eine korrekte Empfehlung noch belastbares Vertrauen schaffen; Google warnt ausdrücklich vor inauthentischen Erwähnungen.

Der Erfolg ist vorab definiert: Bei denselben Fragengruppen prüfen wir in wiederholten Tests, ob die fachlich richtige Zuordnung, eigene Quellen-URLs und passende Empfehlungen häufiger auftreten. Parallel sehen wir auf die Impressionen der betroffenen Seiten, auf Bing-Citations sowie auf qualifizierte Besuche und Anfragen. Wenn nur die Citation-Rate steigt, aber Anfragen ausbleiben, untersuchen wir den Übergang von der Antwort zur Landingpage – nicht nur das nächste KI-Ranking.

Unsere Prioritätenliste für die Umsetzung

1. Technischen Zugang sichern. Für wichtige Seiten prüfen wir HTTP-Status, Canonical, Indexierbarkeit, Snippet-Freigabe, robots.txt/CDN-Sperren und ob technische Informationen als lesbarer Text ohne Login vorhanden sind. Für Google kontrollieren wir zusätzlich den Search-generative-AI-Schalter; für ChatGPT separat den OAI-SearchBot. Eine Freigabe für Suche ist keine automatische Freigabe für Training.

2. Die Quelle besser machen, nicht nur länger. Die wichtigsten Fragen beantworten wir dort, wo sie fachlich hingehören: in einer Anwendungsanleitung, einer sauber gepflegten Kategorieseite oder einem dokumentierten Vergleich. Version, Datum, Autor oder fachliche Prüfung und nachvollziehbare Datengrundlage machen technische Aussagen kontrollierbar. Wir strukturieren mit sinnvollen Überschriften und überprüfbaren Aussagen; wir produzieren nicht 50 dünne Frage-Antwort-Seiten für Prompt-Varianten. Google verlangt für seine KI-Suche weder eine llms.txt noch ein spezielles KI-Schema oder künstlich zerstückelte Inhalte. Strukturierte Daten können für allgemeine SEO-Funktionen nützlich sein, sind aber kein Citation-Schalter.

3. Markenbelege außerhalb der eigenen Domain prüfen. Wir vergleichen die häufig zitierten Fremdseiten mit echten Branchenquellen. Gibt es sachliche Fehler zu unserem Angebot, versuchen wir eine Korrektur beim Herausgeber. Fehlt eine nachvollziehbare Einordnung, liefern wir Fachwissen, Originaldaten oder ein konkretes Anwendungsbeispiel, das ein Medium aus eigenem redaktionellem Interesse aufgreifen kann. Eine bloße Nennung ohne Problembezug hat für eine qualifizierte B2B-Anfrage wenig Wert.

4. Den Weg zur Anfrage testen. Eine Citation auf einen Blogartikel ist nur dann ein Geschäftshebel, wenn Leser den nächsten Schritt erkennen: zur passenden Kategorie, zum Datenblatt oder zur technischen Beratung. Wir markieren die relevanten Seiten in Webanalyse und CRM und bewerten Anfragequalität, nicht nur Sitzungen. Bei Industrieprodukten ist eine Anfrage mit konkreter Baureihe wertvoller als zahlreiche unpassende Klicks.

Was wir bewusst nicht versprechen

Die oft zitierte GEO-Forschungsarbeit berichtet bis zu 40 % mehr Sichtbarkeit in ihren Experimenten, nicht 40 % mehr Google-Klicks oder Umsatz für jeden Shop. Ein wichtiger Teil ihrer Tests nutzte einen eigens aufgebauten Such-/Generierungsprozess; ein weiterer Perplexity-Test arbeitete mit hochgeladenen Quelldateien. Das ist interessante Forschung, aber keine belastbare Erfolgsquote für einen heutigen B2B-Shop.

Ebenso wenig ist eine AI Citation automatisch ein Gütesiegel. Die Quelle kann falsch interpretiert werden, die Frage kann ihre Form ändern, und Antwortsysteme können bei wiederholten Tests andere Links anzeigen. Deshalb führen wir bei DIXENO technisches SEO, fachlich belastbare Inhalte, echte Branchenpräsenz und sauberes Messdesign zusammen. Unsere GEO- und LLMO-Arbeit baut auf unserer SEO-Praxis für B2B und E-Commerce auf – nicht auf einer Abkürzung um sie herum.

Der nächste sinnvolle Schritt: Wählen Sie 24 echte Kundenfragen, dokumentieren Sie Quellen und Markenkontext getrennt und beheben Sie zuerst die fachlich und geschäftlich wichtigste Lücke. Wenn Sie Ihre KI-Sichtbarkeit für einen komplexen B2B-Shop mit einem belastbaren Audit statt mit einer hübschen Zahl bewerten möchten, sprechen Sie mit uns bei DIXENO.

Matthias Eggert Geschäftsführer DIXENO GmbH