# Rohdaten: ChatGPT Kandidatenauswahl im deutschsprachigen Markt Vollständiger Messdatensatz zum Artikel [ChatGPT Sichtbarkeit: Wie die Kandidatenauswahl vor der ersten Suchanfrage entsteht](/ai-search/einordnung/chatgpt-sichtbarkeit-kandidatenauswahl/). 56 Läufe, erhoben am 18. August 2026, ausgelesen über die Chrome DevTools. Diese Datei dient der Nachprüfbarkeit der Zahlen im Artikel. Wenn du sie zitierst oder darauf verweist, freue ich mich über einen Link zurück auf den Artikel. **Einordnung vorab:** Alle Prozentwerte stammen aus einem einzelnen Account, einem Standort und einem Zeitfenster. Sie sind Richtungsangaben, keine Marktzahlen. Die Methodik und ihre Grenzen sind im Artikel ausführlich beschrieben, insbesondere im Abschnitt „Wie ich gemessen habe" und im Realitätsabgleich. --- ## Konfigurationen | | Serie 1 | Serie 2 | |---|---|---| | Datum | 18.08.2026 vormittags | 18.08.2026 mittags | | Modell laut Stream | `gpt-5-6` (9 Läufe), `gpt-5-6-mini` (1 Lauf) | `gpt-5-6-thinking` (10 von 10) | | Modellauswahl | Auto | GPT-5.6 Sol, Aufwand Mittel, fest | | Custom Instructions | aktiv (Ton- und Formatvorgaben) | leer | | Chat-Typ | normal, Memory aus | temporär | | Werkzeuge | nur `web.run` | nur `web.run` | | Standort | Flensburg, IP-basiert | Flensburg, IP-basiert | | Status | Nebenreihe, dokumentiert | **Hauptreihe** | Serie 2 ist die Reihe, auf die sich Aussagen im Artikel stützen. Serie 1 dient dem Modell- und Konfigurationsvergleich. Serie 2p (Paket 7) ist der personalisierte Gegenarm zu Serie 2 und wird ausschließlich gegen sie gestellt, nie mit ihr verrechnet. ### Belegte Vorprüfung - Normaler Chat auf „Was weißt du über mich?": umfangreiche gespeicherte Details, Quellenangaben vorhanden - Temporärer Chat, identische Frage: keine gespeicherten Details, keine Quellenangaben - Temporärer Chat auf direkte Nachfrage nach dem Standort: Flensburg, Schleswig-Holstein, mit ausdrücklichem Vorbehalt des Modells - Einschränkung: Die Standortangabe kam nicht in jedem Durchgang unaufgefordert. Als Beleg dient nicht die Selbstauskunft, sondern die unaufgeforderte Ergänzung von „Deutschland" und „Germany" in den Suchanfragen mehrerer Läufe. --- ## Paket 1, Serie 2: A1 und E1 Fragen: - **A1** (deutsch): Welche Warenwirtschaft eignet sich für einen mittelständischen Großhändler mit 60 Mitarbeitern? - **E1** (englisch): Which ERP system is best for a mid sized wholesaler with 60 employees? Je fünf Läufe, verschachtelt gefahren, zehn verschiedene Konversations-IDs, keine Duplikate. ### Markeninjektion Injektionsquote: **10 von 10 Läufen**. In jedem Lauf enthielt der erste Query-Batch mindestens eine Marke, die im Prompt nicht vorkam. In fünf von zehn Läufen (a1-01, a1-03, a1-04, e1-02, e1-04) bestand der erste Batch **ausschließlich aus `site:`-Abfragen an namentlich bekannte Anbieter**, ohne vorgeschaltete allgemeine Suchanfrage. In diesen Läufen gab es keine Phase, in der ein nicht vorbekannter Anbieter hätte gefunden werden können. ### Markenstabilität über je 5 Läufe | Marke | Deutsch | Englisch | Herkunft | |---|---|---|---| | weclapp | **5/5** | 0/5 | DE | | Sage 100 | 4/5 | 0/5 | DE-Produkt | | Microsoft Dynamics 365 Business Central | 3/5 | **5/5** | US | | proALPHA | 3/5 | 0/5 | DE | | abas ERP | 2/5 | 0/5 | DE | | SAP Business One | 2/5 | 3/5 | DE | | Odoo | 1/5 | 0/5 | BE | | Xentral | 1/5 | 0/5 | DE | | DATEV | 1/5 | 0/5 | DE | | NetSuite | **0/5** | **5/5** | US | | Acumatica | **0/5** | **5/5** | US | | Oracle | 0/5 | 3/5 | US | | Sage Intacct | 0/5 | 2/5 | US-Produkt | **Kernaussage:** Die beiden Kandidatenlisten überschneiden sich fast nicht. Einzige Marke in beiden Sprachen mit hoher Frequenz ist Business Central. Deutsche Anbieter erscheinen in der englischen Fragestellung überhaupt nicht, US-Anbieter wie NetSuite und Acumatica in der deutschen überhaupt nicht. **Zweitaussage:** Die englische Shortlist ist stabiler (drei Marken bei 5/5) als die deutsche (eine Marke bei 5/5). ### Quellenzusammensetzung | | Ergebnisse Hersteller | Ergebnisse Dritt | Anteil Hersteller | |---|---|---|---| | Deutsch, Serie 2 | 384 | 35 | 92 % | | Englisch, Serie 2 | 395 | 146 | 73 % | | Deutsch, Serie 1 | 331 | 31 | 91 % | | Englisch, Serie 1 | 101 | 81 | 55 % | ### Zitationen | | Marker | aufgelöst | Hersteller | Dritt | |---|---|---|---|---| | Deutsch, Serie 2 | 47 | 34 | 34 | 0 | | Englisch, Serie 2 | 49 | 48 | 44 | 4 | | Deutsch, Serie 1 | 32 | 17 | 17 | 0 | | Englisch, Serie 1 | 24 | 9 | 5 | 4 | **Korrektur gegenüber der Serie-1-Auswertung:** Die dort formulierte These, im Englischen führe der Weg über Vergleichs- und Affiliate-Portale, hält in Serie 2 nicht. Der deutsche Wert repliziert (91 zu 92 Prozent), der englische nicht (55 zu 73 Prozent). Der Unterschied geht auf das Modell zurück, nicht auf die Sprache. **Daraus abgeleiteter Befund:** Welche Quellentypen zitiert werden, hängt stärker vom eingesetzten Modell ab als von der Sprache der Frage. Eine AI-Visibility-Messung ohne dokumentiertes Modell misst eine unbestimmte Größe. ### Geo-Signal Unaufgeforderte Ergänzung von Ortsangaben in den Suchanfragen, obwohl im Prompt nicht enthalten: - Serie 1, deutsche Läufe: „Deutschland" mehrfach - Serie 1, e1-04 (englisch): „Germany" - Serie 2, a1-01 (deutsch): „Germany" in einer englischsprachig formulierten Teilquery - Serie 2, a1-05: „Deutschland" Der Standort wirkt unterhalb der Gedächtnisebene und ist vom Nutzer nicht abschaltbar. Temporäre Chats entfernen ihn nicht. ### Bemerkenswerte Einzelbeobachtungen - `proalpha.com/de/grounding-page` erschien in Serie 1 als abgerufenes Ergebnis. Ein deutscher ERP-Anbieter betreibt eine Grounding Page. - In Serie 2, a1-04 wurden microtech und mesonic per `site:`-Abfrage angesteuert. Das Modell kennt die Kategorie über die Marktführer hinaus bis in den deutschen Mittelbau. - microtech.de wurde in a1-04 zitiert. - In Serie 1 wurde SAP in einem Lauf zwölfmal abgerufen, aber weder zitiert noch erwähnt. --- ## Paket 2, Serie 2: F2, Beschwerde ohne Kaufabsicht Frage, wörtlich, ohne Fragezeichen: > Unsere Zeiterfassung nervt das ganze Team und die monatliche Auswertung dauert ewig. Drei Läufe, drei verschiedene Konversations-IDs, alle `gpt-5-6-thinking`. ### Ergebnis: keine Websuche, in keinem Lauf | Lauf | Werkzeug aufgerufen | Fan-Out-Queries | Marken genannt | Antwortlänge | |---|---|---|---|---| | f2-01 | keines | 0 | keine | 1.339 Zeichen | | f2-02 | keines | 0 | keine | 800 Zeichen | | f2-03 | keines | 0 | keine | 659 Zeichen | Alle drei Antworten behandelten die Aussage als Prozessfrage: Pflichtfelder reduzieren, Eingabefehler früh abfangen, Auswertung anders strukturieren. Kein Anbieter, kein Produkt, keine Empfehlung. ### Einordnung Das widerspricht dem Referenzfall bei Mohanadasan. Dort wurde eine Beschwerde über unaufgeräumte Meeting-Notizen vor dem ersten Seitenabruf in eine gezielte Anbieterabfrage übersetzt. Abgeleiteter Befund: Die Kandidatenbildung ist an eine erkennbare Kaufabsicht gebunden, nicht an das geschilderte Problem. Ohne Lösungsfrage entsteht kein Kandidatenset, und die gesamte Mechanik läuft nicht an. ### Nicht isolierte Variablen | Variable | Referenzfall | dieser Test | |---|---|---| | Sprache | Englisch | Deutsch | | Kategorie | Meeting-Notizen | Zeiterfassung | | Modell | GPT-5-Generation, Juli 2026 | `gpt-5-6-thinking`, August 2026 | | Formulierung | Aufgabenlücke | Prozessreibung | Eine Aussage der Form „im Deutschen tritt das nicht auf" ist aus drei Läufen mit einer Formulierung und einer Kategorie nicht belegbar. Offener Zusatztest: F2b mit der Originalformulierung „our meeting notes are a mess and nobody writes them up", drei Läufe, gleiche Konfiguration. --- ## Paket 2b, Serie 2: F2b, Originalformulierung englisch Frage, wörtlich, im Originalwortlaut der Referenzuntersuchung: > our meeting notes are a mess and nobody writes them up Drei Läufe, drei verschiedene Konversations-IDs, alle `gpt-5-6-thinking`. ### Ergebnis: erneut keine Websuche | Lauf | Werkzeug | Fan-Out-Queries | Marken | Antwortlänge | |---|---|---|---|---| | f2b-01 | keines | 0 | keine | 657 Zeichen | | f2b-02 | `suggest_automation` | 0 | keine | 4.997 Zeichen | | f2b-03 | keines | 0 | keine | 932 Zeichen | Alle drei Antworten behandelten die Aussage als Ablaufproblem: gemeinsame Vorlage, rotierender Protokollverantwortlicher, letzte drei bis fünf Minuten der Besprechung für Entscheidungen und Aufgaben reservieren. Kein Anbieter, kein Produkt. In f2b-02 rief das Modell `suggest_automation` auf, wollte also einen wiederkehrenden Ablauf einrichten statt ein Produkt zu empfehlen. ### Kontrollbeleg innerhalb derselben Daten | Test | Sprache | Frageform | Websuche ausgelöst | |---|---|---|---| | E1, 5 Läufe | Englisch | Kaufabsicht | 5 von 5 | | F2, 3 Läufe | Deutsch | Beschwerde | 0 von 3 | | F2b, 3 Läufe | Englisch | Beschwerde, Originalwortlaut | 0 von 3 | Gleicher Account, gleiches Modell, gleiches Zeitfenster. Sprache und Kategorie scheiden damit als Erklärung aus. Der Auslöser ist die erkennbare Kaufabsicht. ### Belastbarer Befund Der Referenzfall, in dem eine Beschwerde über unaufgeräumte Meeting-Notizen vor dem ersten Seitenabruf in eine gezielte Anbieterabfrage übersetzt wurde, ist auf `gpt-5-6-thinking` im August 2026 nicht reproduzierbar. ### Weiterhin offen Modell und Zeitpunkt sind vermengt. Zwischen der Referenzuntersuchung (GPT-5-Generation, Juli 2026) und diesem Test liegen beide Änderungen. Offener Isolationstest: dieselbe englische Beschwerde mit Aufwand „Sofort", was sich voraussichtlich auf die nicht denkende Variante `gpt-5-6` auflöst. Drei Läufe, Präfix `x-`, nicht Teil von Serie 2. --- ## Paket 3, Serie 2: A2 und E2, Zeiterfassung Fragen: - **A2** (deutsch): Welche Zeiterfassung ist DSGVO konform und für ein Unternehmen mit 80 Mitarbeitern geeignet? - **E2** (englisch): Which time tracking software is best for a company with 80 employees? Je fünf Läufe, verschachtelt, zehn verschiedene Konversations-IDs, alle `gpt-5-6-thinking`, alle mit `web.run`. ### Markenstabilität über je 5 Läufe | Deutsch | Frequenz | Herkunft | Englisch | Frequenz | Herkunft | |---|---|---|---|---|---| | Personio | **5/5** | DE | Clockify | **5/5** | international | | Papershift | **5/5** | DE | Toggl Track | **5/5** | international | | clockodo | 4/5 | DE | Harvest | **5/5** | international | | timr | 2/5 | AT | QuickBooks Time | 4/5 | international | | TimeTac | 1/5 | AT | Hubstaff | 1/5 | international | | ZEP | 1/5 | DE | | | | | clockin | 1/5 | DE | | | | | Factorial | 1/5 | ES, deutsche Domain | | | | **Überschneidung: null.** Keine Marke erscheint in beiden Sprachen. Deutlichere Trennung als in Paket 1, wo Business Central noch in beiden Listen stand. Die englische Shortlist ist erneut stabiler: drei Marken bei 5/5 gegen zwei auf Deutsch. Gleiches Muster wie Paket 1. In vier von fünf deutschen Läufen (a2-02 bis a2-05) begann der erste Batch ausschließlich mit `site:`-Abfragen an namentlich bekannte Anbieter. ### Quellenzusammensetzung | | Ergebnisse Hersteller | Ergebnisse Dritt | Anteil Hersteller | |---|---|---|---| | Deutsch, Zeiterfassung | 420 | 79 | 84 % | | Englisch, Zeiterfassung | 261 | 236 | 53 % | ### Zitationen | | Marker | aufgelöst | Hersteller | Dritt | |---|---|---|---|---| | Deutsch, Zeiterfassung | 60 | 36 | 33 | 3 | | Englisch, Zeiterfassung | 42 | 36 | 36 | 0 | **Zentraler Befund:** In den englischen Läufen stammten 47 Prozent der abgerufenen Ergebnisse von Drittseiten, aber null Prozent der Zitate. Über Paket 1 und 3 zusammen wurden in den englischen Läufen 382 Ergebnisse von Drittseiten abgerufen und vier zitiert. Auf Deutsch 3 von 70. Vergleichsportale, Affiliate-Listen und Roundups liefern Retrieval, aber praktisch keine Zitation. ChatGPT liest sie offenbar zur Kandidatenbestätigung und belegt anschließend auf der Herstellerseite, überwiegend auf Preis- und Supportseiten. **Nuance:** Die drei zitierten Drittseiten der deutschen Läufe waren dsgvo-gesetz.de, keyed.de und das Bayerische Landesamt für Datenschutzaufsicht. Drittseiten werden zitiert, wenn sie eine Rechts- oder Sachfrage belegen, nicht wenn sie Produkte vergleichen. ### Sprachthese über vier Kombinationen | Sprache und Kategorie | Anteil Herstellerseiten | |---|---| | Deutsch, Warenwirtschaft | 92 % | | Deutsch, Zeiterfassung | 84 % | | Englisch, Warenwirtschaft | 73 % | | Englisch, Zeiterfassung | 53 % | Deutsch liegt konstant hoch, Englisch niedriger und stärker streuend. Die nach Paket 1 formulierte Korrektur, der Unterschied gehe allein auf das Modell zurück, war ebenfalls zu weitgehend. Das Modell verschiebt das Niveau, Sprache und Kategorie bestimmen die Streuung. ### Anschluss Personio steht in fünf von fünf deutschen Läufen und ist damit der Platzhirsch in ChatGPTs deutscher Shortlist. Die geplante F3-Frage nach einer Alternative zu Personio trifft damit den Marktführer der Kandidatenliste. --- ## Paket 2c: Isolationstest, Aufwand „Sofort" Gleiche Frage wie F2b, im Originalwortlaut. Aufwand auf „Sofort" gestellt, Präfix `x-`, nicht Teil von Serie 2. | Lauf | Modell laut Stream | Werkzeug | Fan-Out-Queries | Websuche | |---|---|---|---|---| | x-f2b-sofort-01 | `gpt-5-6` | `suggest_automation` | 0 | nein | | x-f2b-sofort-02 | `gpt-5-6` | keines | 0 | nein | | x-f2b-sofort-03 | `gpt-5-6` | `suggest_automation` | 0 | nein | ### Ergebnis: Modellklasse scheidet als Erklärung aus | Test | Modell | Frageform | Websuche | |---|---|---|---| | A1, E1, Serie 1 | `gpt-5-6` | Kaufabsicht | ja | | A1, E1, Serie 2 | `gpt-5-6-thinking` | Kaufabsicht | ja | | F2, F2b, Serie 2 | `gpt-5-6-thinking` | Beschwerde | nein | | F2b Sofort | `gpt-5-6` | Beschwerde | nein | Dieselbe Modellklasse `gpt-5-6` sucht bei Kaufabsicht und sucht nicht bei einer Beschwerde. Reasoning gegen Instant macht keinen Unterschied. **Verbleibende, nicht trennbare Variable:** Modellgeneration beziehungsweise Pipeline-Änderung zwischen Ende Juli und August 2026. Von außen nicht auflösbar. ### Nebenbefunde - In allen drei Läufen enthält der Stream einen vorab eingespielten Entwicklerblock mit vorgeladenen Ergebnissen aus einem `genui_search`-Kommando. Das betrifft die Auswahl von Anzeige-Widgets, nicht die Markenauswahl. Relevante Präzisierung: Keine Websuche bedeutet nicht, dass nichts in den Kontext geladen wurde. - `suggest_automation` in zwei von drei Läufen. Über alle sechs Beschwerdeläufe hinweg drei Aufrufe. ChatGPT bietet bei einer Beschwerde an, einen Ablauf einzurichten, statt ein Produkt zu suchen. --- ## Paket 4, Serie 2: B1 und B2, Beratungskategorien Fragen: - **B1**: Wen kannst du als SEO Berater für einen deutschen Mittelständler empfehlen? - **B2**: Wer berät im deutschsprachigen Raum zu Sichtbarkeit in KI-Suchsystemen? Je fünf Läufe, zehn verschiedene Konversations-IDs, alle `gpt-5-6-thinking`, alle mit `web.run`. ### Der strukturelle Bruch | Kategorie | Markeninjektion in der ersten Query | |---|---| | A1, E1, A2, E2 (Software, Produkt) | **20 von 20 Läufen** | | B1, B2 (Beratung, Dienstleistung) | **1 von 10 Läufen** | In neun von zehn Läufen suchte ChatGPT generisch, etwa „SEO Beratung Mittelstand Deutschland B2B Agentur Referenzen" oder „Deutschland Agentur Beratung Generative Engine Optimization GEO AI Search Sichtbarkeit". Keine vorbelegte Kandidatenliste, keine `site:`-Abfragen an Anbieter. Einzige Ausnahme: b1-05 mit Claneo, eology, morefire und Peak Ace in den Queries. Statt Anbieterdomains wurden Verzeichnisse angesteuert: clutch.co, omr.com, bvdw.org, omt.de, agenturranker.de, geoagenturen.de. ### Umkehrung des Zitationsbefunds aus Paket 3 In der Dienstleistungskategorie werden Verzeichnisse und Vergleichsinhalte tatsächlich zitiert. Häufigkeit über zehn Läufe, in denen die Domain unter den Zitationszielen auftauchte: | Domain | Läufe | |---|---| | evergreen.media | 5 | | omr.com | 3 | | dlick.de | 3 | | claneo.com | 3 | | ab3.ch, blueglass.ch, artaxo.com, ithelps-digital.com, jvm.ch, onehundred.digital, sunzinet.com, suchmeisterei.de | je 2 | ### Zwei-Modi-Modell | | Produktkategorie | Dienstleistungskategorie | |---|---|---| | Kandidatenliste | vorbelegt, oft ohne Sondierung | wird generisch gesucht | | Zitierte Quellen | überwiegend Herstellerseiten | Verzeichnisse, Vergleiche, Agenturseiten | | Entscheidungsort | Modellwissen vor dem Retrieval | Retrieval selbst | | Wirksamer Ansatz | Marken- und Entitätsarbeit über Jahre | klassisches SEO plus Verzeichnispräsenz | Der verbreitete Ratschlag, in Roundups und Vergleichsportale zu kommen, ist damit nicht falsch, sondern kategorieabhängig. In der Softwarekategorie kauft er Retrieval ohne Zitation. In der Dienstleistungskategorie ist er der Hauptweg. --- ## Paket 5, Serie 2: F1 und F3, Frageformen Fragen: - **F1**: Welche Zeiterfassung sollten wir im Unternehmen einführen? - **F3**: Was können wir statt Personio für die Zeiterfassung nutzen? Je drei Läufe, alle `gpt-5-6-thinking`, alle mit `web.run`. ### Die Schwelle | Frageform | Websuche | Marken in der ersten Query | |---|---|---| | F2, Beschwerde ohne Kaufabsicht | 0 von 3 | keine | | F1, Empfehlungsfrage ohne Markennennung | 3 von 3 | Personio, clockodo, Papershift | | F3, Alternative zu genanntem Anbieter | 3 von 3 | Personio plus Alternativen | | A2, Anforderungsfrage mit DSGVO-Bezug | 5 von 5 | Personio, Papershift, clockodo | Auslöser ist die erkennbare Kaufabsicht, nicht die Frageform und nicht das Wort „beste". „Welche Zeiterfassung sollten wir einführen" genügt, und es erscheinen dieselben drei deutschen Anbieter wie bei A2. ### Weitere Beobachtungen **Zerlegung in Regulierung und Produkt.** In allen drei F1-Läufen recherchierte ChatGPT die Rechtslage getrennt, mit Abfragen an bmas.de und bundesarbeitsgericht.de, teils per `site:`. Der Fan-Out behandelt den Regulierungs- und den Produktteil der Frage unterschiedlich. **Kategorie der Drittseiten wechselt mit der Frageform.** In F1 traten stark Vergleichsportale auf: capterra, getapp, hr-software-vergleich.de, tool-berater.de, dienstleister-software.de. Bei der DSGVO-Frage A2 war das Feld deutlich enger und herstellerlastiger. **Verdrängung funktioniert.** F3 erzeugte in allen drei Läufen eine Alternativenliste zu Personio mit clockodo, Papershift, TimeTac, Crewmeister und clockin. Wer im Modellwissen als Alternative zum Platzhirsch verankert ist, wird genannt, ohne gefragt worden zu sein. --- ## Paket 6, Serie 2: D1, physisches Produkt im regionalen Handel Frage: Wo bestellt ein Handwerksbetrieb in Norddeutschland Baubeschläge und Beschlagtechnik? Fünf Läufe, fünf verschiedene Konversations-IDs, alle `gpt-5-6-thinking`, alle mit `web.run`. ### Ergebnis: keine Kandidatenvorbelegung **Markeninjektion in der ersten Query: 0 von 5.** Alle Erstqueries generisch, etwa „Baubeschläge Beschlagtechnik Großhandel Norddeutschland Handwerk Händler". In zwei Läufen (d1-03, d1-04) erschienen Häfele und Würth in späteren Queries desselben Batches, also nach der offenen Suche. ### Zitierte Quellen Breit gestreut über drei Typen: | Typ | Beispiele | |---|---| | Regionale Händler | loeschgroup.de, siefert-baubeschlag.de, bergedorfer-baubeschlag.de, wilhelm-albers-hamburg.de, lueckundlueck.de, seefelder.net, paul-paschke.de, topf-online.de | | Hersteller | haefele.de, hettich.com, wuerth.de, maco.eu | | Verzeichnisse und Referenz | gelbeseiten.de, de.wikipedia.org | ### Geo-Effekt, deutlichster im gesamten Projekt Im Prompt stand ausschließlich „Norddeutschland". ChatGPT ergänzte unaufgefordert Hamburg, Bremen, Hannover, Kiel und Schleswig-Holstein. Kiel und Schleswig-Holstein sind die geografisch nächstliegenden Ergänzungen zum IP-Standort Flensburg. ### Korrektur des Zwei-Modi-Modells Die Trennlinie verläuft **nicht** zwischen Produkt und Dienstleistung. Baubeschläge sind ein Produkt und verhalten sich wie die Beratungskategorie. Entscheidend ist, ob die Kategorie im Modellwissen einen stabilen, bundesweit konsolidierten Anbieterkreis besitzt. | | konsolidierte Kategorie | fragmentierte Kategorie | |---|---|---| | Beispiele im Datensatz | Warenwirtschaft, Zeiterfassung | SEO-Beratung, AI-Search-Beratung, regionaler Beschlaghandel | | Markeninjektion erste Query | 20 von 20 Läufen | 1 von 15 Läufen | | Erste Suchanfrage | oft direkt `site:`-Abfrage an Anbieter | generisch | | Zitierte Quellen | überwiegend Herstellerseiten | Händler, Verzeichnisse, Vergleiche, Hersteller gemischt | | Entscheidungsort | Modellwissen vor dem Retrieval | Retrieval | | Wirksamer Ansatz | Marken- und Entitätsarbeit über Jahre | klassisches SEO, Verzeichnispräsenz, regionale Signale | --- ## Paket 7, Serie 2p: personalisierter Arm Sechs Läufe, sechs verschiedene Konversations-IDs, alle `gpt-5-6-thinking`. Bewusst anders konfiguriert als Serie 2 und deshalb **gegen** die entsprechenden Serie-2-Läufe zu stellen, nicht mit ihnen zusammenzuwerfen. | | Serie 2 (sauber) | Serie 2p (personalisiert) | |---|---|---| | Chat-Typ | temporär | normal | | Erinnerungen | aus | aktiv | | Custom Instructions | leer | zurückgepastet, Ton- und Formatvorgaben | | Nutzerprofil im Kontext | nein | ja (`Preferred name: Carsten`, `Role: SEO Berater`) | | Modell | `gpt-5-6-thinking` | `gpt-5-6-thinking` | | Standort | Flensburg, IP-basiert | Flensburg, IP-basiert | Die Konfiguration ist aus den Streams belegt, nicht aus der Oberfläche behauptet: Jeder der sechs Läufe enthält eine Nachricht vom Typ `user_editable_context` mit den Feldern `user_profile` und `user_instructions`. In den temporären Läufen der Serie 2 fehlt dieser Block. ### Leitfrage 1: Verschiebt die Historie die Kandidatenliste? Nein. Verglichen werden die drei `s2p-a2`-Läufe gegen die fünf sauberen A2-Läufe aus Paket 3, gleiche Frage, gleiches Modell. **Markeninjektion in der ersten Query: 3 von 3.** Wie in der sauberen Reihe (5 von 5). In zwei der drei Läufe (`s2p-a2-02`, `s2p-a2-03`) bestand der erste Batch ausschließlich aus `site:`-Abfragen, in der sauberen Reihe in vier von fünf. | Marke | Serie 2, 5 Läufe | Serie 2p, 3 Läufe | |---|---|---| | Personio | 5/5 | **3/3** | | Papershift | 5/5 | **3/3** | | clockodo | 4/5 | **3/3** | | timr | 2/5 | 2/3 | | ZEP | 1/5 | 1/3 | | TimeTac | 1/5 | 0/3 | | clockin | 1/5 | 0/3 | | Factorial | 1/5 | 0/3 | Keine Marke tauchte auf, die in der sauberen Reihe nicht vorkam. Die drei Einzelnennungen der sauberen Reihe fehlen, was bei einer Frequenz von 1 aus 5 in drei Läufen zu erwarten ist. Die Kandidatenliste ist innerhalb der Streuung identisch. Erste Query-Batches im Wortlaut: - `s2p-a2-01`: eine allgemeine Query mit Personio darin, dann drei Markenqueries zu Papershift, Clockodo, ZEP - `s2p-a2-02`: `site:personio.de`, `site:clockodo.com`, `site:timr.com`, `site:papershift.com` - `s2p-a2-03`: dieselben vier `site:`-Abfragen, ergänzt um die Jahreszahl 2026 **Fan-Out-Breite: 4 Queries in allen drei Läufen.** Deckt sich mit der Angabe der Primärquelle, dass der Fan-Out Anfang August von 12 auf 4 Suchen pro Antwort gefallen ist. ### Quellen und Zitationen im personalisierten Arm Zitiert wurden Herstellerseiten sowie dsgvo-gesetz.de, bmas.de und bundesarbeitsgericht.de. **Kein einziges Vergleichsportal zitiert.** Das repliziert den Befund aus Paket 3 exakt: Drittseiten werden zitiert, wenn sie eine Rechtsfrage belegen, nicht wenn sie Produkte vergleichen. Bei den abgerufenen Drittseiten trennt sich das Feld deutlich: In `s2p-a2-02` und `s2p-a2-03` bestanden die Drittabrufe ausschließlich aus bmas.de und bundesarbeitsgericht.de. `s2p-a2-01` zog ein breiteres Feld (dr-datenschutz.de, e-recht24.de, datenschutz-guru.de, kuketz-forum.de, trusted.de, omr.com). **Zählweisen-Vorbehalt:** Der Herstelleranteil liegt hier bei 69 bis 73 Prozent je Lauf, gegenüber 84 Prozent in der sauberen deutschen Zeiterfassungsreihe. Diese Zahlen sind **nicht direkt vergleichbar**, weil hier über eindeutige, normalisierte Ergebnis-URLs gezählt wurde und in Paket 1 und 3 über Ergebnistreffer. Die Differenz kann ein Zählartefakt sein. Bis zur Nachzählung nach derselben Methode: kein Befund. **Abrufrauschen:** Die Query „ZEP Zeiterfassung DSGVO Hosting Deutschland AVV" zog getzep.com in den Ergebnissatz, eine US-Plattform für Agenten-Speicher ohne jeden Bezug zur Zeiterfassung. Markennamenkollision, nicht Kategoriewissen. ### Leitfrage 2: Senkt die Historie die Kaufabsichtsschwelle? Nein. **0 von 3 Läufen mit Websuche**, 0 Fan-Out-Queries, kein Werkzeugaufruf. | Test | Konfiguration | Websuche | |---|---|---| | F2, 3 Läufe | temporär, ohne Historie | 0 von 3 | | F2b, 3 Läufe | temporär, englischer Originalwortlaut | 0 von 3 | | F2 Sofort, 3 Läufe | temporär, `gpt-5-6` | 0 von 3 | | **F2, Serie 2p, 3 Läufe** | **normal, Erinnerungen und CI aktiv** | **0 von 3** | Damit stehen zwölf Beschwerdeläufe über zwei Sprachen, zwei Modellklassen und zwei Personalisierungszustände ohne eine einzige Websuche. ### Der eigentliche Befund: Die Erinnerung wirkte, die Mechanik nicht Die Erinnerung war nachweislich aktiv und hat den Antwortinhalt verändert. Im F2-Prompt steht keine Mitarbeiterzahl. Trotzdem rechnen zwei der drei Antworten mit einer: - `s2p-f2-01`: „Bei rund 80 Mitarbeitern würde ich außerdem keine klassische Stempeluhr mit hübscher App auswählen" - `s2p-f2-02`: „Gerade bei 80 Mitarbeitenden kann sich daraus schnell ein erheblicher administrativer Aufwand summieren" Die 80 stammen aus der A2-Frage, die Minuten vorher im selben Account lief. Beide Läufe tragen am Antwortende einen `memcite`-Marker, den Beleg für einen Erinnerungsabruf. `s2p-f2-03` hat keinen solchen Marker und fragt die Mitarbeiterzahl stattdessen zurück. **Die Personalisierung transportiert Fakten, sie erzeugt keine Kaufabsicht.** Das Modell übernahm die Unternehmensgröße und suchte trotzdem nicht, bildete kein Kandidatenset und nannte keinen Anbieter. Verschärfend: In zwei von drei Läufen **bot das Modell die Anbietersuche als nächsten Schritt an**, statt sie auszuführen. - `s2p-f2-01`: Angebot, ein Anforderungsprofil zu erstellen und „5 bis 7 DSGVO-taugliche Systeme für ein Unternehmen dieser Größenordnung" zu vergleichen - `s2p-f2-02`: Angebot, „aktuell geeignete Systeme zu vergleichen und auf 4 bis 5 realistische Kandidaten zu reduzieren" Es bleibt einen Schritt vor der Schwelle stehen und bietet an, sie zu überschreiten. Die Kaufabsicht muss vom Nutzer kommen. ### Nebenbefund: Markennennung ohne Suche und ohne Kandidatenauswahl In allen drei F2-Läufen erscheint **DATEV** im Antworttext, ausschließlich als Schnittstellenkontext („Export nach DATEV", „DATEV- und Lohnschnittstellen"), nie als Empfehlung. Kein Abruf, kein Zitat, keine Kandidatenphase. Das ist eine vierte Kategorie neben `fetched`, `cited` und `mentioned`: eine Marke, die als Infrastrukturbegriff im Text landet. Ein Monitoring-Tool, das auf Markennennungen zählt, würde das als Erwähnung werten. ### Antwortlängen | Lauf | Serie 2 (sauber) | Serie 2p (personalisiert) | |---|---|---| | F2-01 | 1.339 Zeichen | 1.905 Zeichen | | F2-02 | 800 Zeichen | 2.342 Zeichen | | F2-03 | 659 Zeichen | 3.701 Zeichen | Die personalisierten Antworten sind durchgehend länger und stärker gegliedert. Das ist mit hoher Wahrscheinlichkeit ein Effekt der Custom Instructions, die Struktur, Zwischenüberschriften und Listen vorgeben. Es ist kein Kandidatenbefund und darf nicht als solcher gelesen werden. ### Nicht isolierte Variablen und Grenzen | Variable | Status | |---|---| | Erinnerung und Custom Instructions | gemeinsam aktiviert, Einzeleffekte nicht trennbar | | Herkunft der Erinnerung | im Test selbst erzeugt, die A2-Läufe liefen kurz vorher im selben Account | | Stichprobe | 3 Läufe je Bedingung | | Anrede | uneinheitlich, `s2p-f2-02` siezt, `s2p-f2-03` duzt, trotz identischer Konfiguration | Die Historie in diesem Arm ist eine frisch erzeugte, sehr kurze. Ein über Jahre gewachsener Account mit hunderten Zeiterfassungsrecherchen ist damit nicht getestet. Belegt ist: Eine Historie, die den konkreten Anwendungsfall bereits enthält, verschiebt die Kandidatenliste nicht und löst bei einer Beschwerde keine Anbietersuche aus. ### Anschluss an die offene Frage der Primärquelle Die Primärquelle lässt offen, ob die beobachteten Shortlists Modellwissen oder Personalisierung sind. Dieser Arm zeigt in Richtung Modellwissen: gleicher Account, gleicher Tag, gleiche Frage, einmal mit und einmal ohne Historie, praktisch identische Kandidatenliste. Das ist ein Indiz aus acht Läufen, kein Beweis. --- ## Übersicht aller Pakete | Paket | Inhalt | Läufe | |---|---|---| | 1 | A1 und E1, Warenwirtschaft | 10 | | 2 | F2, Beschwerde ohne Kaufabsicht | 3 | | 2b | F2b, Originalformulierung englisch | 3 | | 2c | Isolationstest Aufwand „Sofort", Präfix `x-` | 3 | | 3 | A2 und E2, Zeiterfassung | 10 | | 4 | B1 und B2, Beratungskategorien | 10 | | 5 | F1 und F3, Frageformen | 6 | | 6 | D1, physisches Produkt, regionaler Handel | 5 | | 7 | Serie 2p, personalisierter Arm | 6 | **Insgesamt 56 ausgewertete Läufe** (Serie 1: 10, Serie 2: 37, Isolationstest: 3, Serie 2p: 6). ## Tragende Befunde 1. **Kandidatenvorbelegung bei Kaufabsicht in konsolidierten Kategorien**, 20 von 20 Läufen, in mehreren Läufen ohne jede Sondierungsphase 2. **Sprachtrennung**: deutsche und englische Fragen erzeugen praktisch disjunkte Kandidatenlisten, bei Zeiterfassung mit null Überschneidung 3. **Kategorieabhängigkeit**: fragmentierte Kategorien haben keine vorbelegte Liste, dort entscheidet das Retrieval. Trennlinie ist die Konsolidierung des Anbieterkreises, nicht Produkt gegen Dienstleistung 4. **Zitationsasymmetrie**: In konsolidierten Kategorien werden Vergleichsportale gelesen, aber kaum zitiert. In fragmentierten Kategorien sind Verzeichnisse und Vergleiche eine Hauptquelle 5. **Kaufabsicht als Schalter**: Ohne sie läuft die Mechanik gar nicht an, belegt über zwölf Läufe, zwei Sprachen, zwei Modellklassen, mit und ohne Personalisierung 6. **Halbwertszeit**: Der Referenzfall aus der Primärquelle ist im August 2026 nicht reproduzierbar 7. **Geo-Signal**: unaufgeforderte Ergänzung von Ländern und Regionen in mehreren Paketen, am deutlichsten in Paket 6 8. **Personalisierung verschiebt die Kandidatenliste nicht**: gleicher Account, gleicher Tag, gleiche Frage, mit und ohne aktive Erinnerungen praktisch identische Liste. Die Erinnerung transportiert Fakten in die Antwort, erzeugt aber keine Kaufabsicht und löst keine Suche aus --- ## Primärquelle Suganthan Mohanadasan: „ChatGPT Already Knows Who's In The Running Before It Searches", veröffentlicht 10. August 2026, aktualisiert 17. August 2026. suganthan.com/blog/chatgpt-decides-before-it-searches/ Diese Untersuchung ist eine unabhängige Replikation und Erweiterung für den deutschsprachigen Markt, nicht Teil der Primärquelle.