A/B-Tests - Richtig planen und ehrlich auswerten
Die meisten A/B-Tests in Marketingteams liefern keine verwertbaren Ergebnisse, nicht wegen falscher Werkzeuge, sondern wegen falscher Planung. Zu kleine Datenmengen, zu früh beendet, zu viel gleichzeitig verändert. Hier erfährst du, wie du es besser machst.
Was ein A/B-Test leisten kann
Ein A/B-Test vergleicht zwei Varianten unter gleichen Bedingungen. Der Traffic wird zufällig aufgeteilt, beide laufen parallel, und am Ende vergleichst du eine vorher festgelegte Kennzahl.
Der Wert liegt in der Zufallszuteilung. Sie sorgt dafür, dass äussere Einflüsse, Wochentag, Wetter, Kampagnenschwankungen, beide Varianten gleichermassen treffen. Genau das unterscheidet einen Test von einem Vorher-Nachher-Vergleich, der praktisch immer verfälscht ist.
Was ein Test nicht leistet: Er erklärt nicht, warum etwas besser funktioniert. Dafür brauchst du qualitative Methoden, Nutzerbefragungen, Aufzeichnungen, Gespräche.
Mit einer Hypothese starten
Der häufigste Planungsfehler ist, einfach etwas auszuprobieren.
Formuliere stattdessen eine Hypothese in drei Teilen: die Beobachtung, die Änderung und die erwartete Wirkung. Zum Beispiel: «Weil viele Besucher das Formular auf halber Strecke abbrechen, reduzieren wir die Pflichtfelder von neun auf vier und erwarten eine höhere Abschlussquote.»
Der Nutzen zeigt sich am Ende: Ein Test ohne Hypothese liefert dir eine Zahl. Ein Test mit Hypothese liefert dir eine Erkenntnis, die auf andere Seiten übertragbar ist.
Nimm die Beobachtung dabei aus Daten, nicht aus dem Bauch: Analytics-Trichter, Aufzeichnungen, Supportanfragen, Suchbegriffe.
Die Datenmenge vorher berechnen
Der wichtigste und am häufigsten übersprungene Schritt. Bevor du startest, solltest du wissen, wie viele Conversions du für ein aussagekräftiges Ergebnis brauchst.
Die benötigte Menge hängt von drei Grössen ab: deiner aktuellen Conversion-Rate, dem Unterschied, den du erkennen willst, und der gewünschten Sicherheit.
Der entscheidende Zusammenhang ist unbequem: Je kleiner der erwartete Unterschied, desto mehr Daten brauchst du und zwar überproportional. Eine Verbesserung um zwanzig Prozent lässt sich mit überschaubaren Mengen nachweisen. Eine um zwei Prozent braucht ein Vielfaches davon.
Nutze einen der frei verfügbaren Stichprobenrechner. Wenn das Ergebnis lautet, dass du bei deinem Traffic acht Monate testen müsstest, ist das eine wertvolle Information – dann teste etwas Grösseres oder gar nicht.
Laufzeit und Abbruchdisziplin
Zwei Regeln zur Laufzeit sind nicht verhandelbar.
Erstens: Lass den Test mindestens zwei volle Wochen laufen, auch wenn die Datenmenge früher erreicht ist. Nutzerverhalten unterscheidet sich zwischen Wochentagen und Wochenende deutlich. Ein Test über vier Tage misst ein Verhaltensmuster, nicht die Realität.
Zweitens: Beende den Test nicht vorzeitig, weil eine Variante führt. Das ist der häufigste methodische Fehler überhaupt. Bei kleinen Datenmengen schwanken die Werte stark, und jede Variante führt irgendwann zwischendurch. Wer in diesem Moment abbricht, hat Zufall gemessen.
Leg deshalb vorher fest: Datum und Datenmenge, bei denen ausgewertet wird. Dann schau bis dahin nicht mehr hin, oder zumindest triff keine Entscheidungen.
Eine Änderung pro Test
Wenn du Überschrift, Bild, Formular und Schaltfläche gleichzeitig änderst und die Variante gewinnt, weisst du nur eines: dass irgendetwas davon gewirkt hat.
Für Erkenntnisse brauchst du Isolation. Ändere ein Element und lass den Rest identisch.
Die Ausnahme: Wenn du einen komplett neuen Ansatz gegen den bestehenden testen willst – etwa eine grundlegend andere Seitenstruktur, ist ein Radikalvergleich sinnvoll. Aber sei dir bewusst, dass du danach nicht weisst, welcher Teil den Unterschied gemacht hat.
Die richtige Kennzahl wählen
Miss möglichst nah am Geschäftsziel. Eine Variante, die mehr Klicks auf eine Schaltfläche erzeugt, aber weniger abgeschlossene Käufe, ist keine Verbesserung.
Leg eine primäre Kennzahl fest, an der du entscheidest, und beobachte zwei bis drei sekundäre, um unerwünschte Nebenwirkungen zu erkennen. Bei Shops gehört der durchschnittliche Bestellwert immer zu den sekundären – eine Variante kann die Abschlussrate erhöhen und gleichzeitig den Warenkorbwert senken.
Umgang mit dem Ergebnis
Drei Ausgänge sind möglich, und alle drei sind nützlich.
Die Variante gewinnt. Umsetzen und prüfen, ob sich die Erkenntnis auf andere Seiten übertragen lässt.
Die Variante verliert. Ebenso wertvoll. Du hast gelernt, dass eine plausible Annahme nicht stimmt, und kannst diese Richtung streichen.
Kein messbarer Unterschied. Der häufigste Ausgang. Er bedeutet nicht, dass die Änderung wirkungslos ist, nur, dass ihr Effekt kleiner ist, als deine Datenmenge erkennen kann. Setz die Variante um, wenn sie aus anderen Gründen besser ist, und teste künftig grössere Unterschiede.
Dokumentiere jeden Test mit Hypothese, Aufbau, Laufzeit und Ergebnis. Nach zwei Jahren ist diese Sammlung wertvoller als jedes einzelne Ergebnis.
Wann Testen nicht sinnvoll ist
Bei sehr wenig Traffic ist ein statistisch belastbarer Test schlicht nicht möglich. Dann helfen andere Methoden mehr: Nutzerbefragungen, Aufzeichnungen von Sitzungen, Gespräche mit Kundinnen und Kunden, oder schlicht die Behebung offensichtlicher Probleme.
Auch bei eindeutigen Fehlern lohnt kein Test. Ein kaputtes Formular repariert man, man testet es nicht gegen die kaputte Version.
Typische Fallstricke
Zu viele Tests parallel. Wenn zwei Tests auf derselben Nutzerreise laufen, beeinflussen sie sich gegenseitig.
Ungleiche Ausgangsbedingungen. Wenn eine Variante langsamer lädt als die andere, testest du Ladezeit statt Inhalt.
Ausreisser ignorieren. Ein einzelner Grossauftrag kann bei Umsatzkennzahlen das gesamte Ergebnis kippen. Prüf die Verteilung, nicht nur den Durchschnitt.
Nur Gewinner dokumentieren. Verlorene Tests sind die günstigste Form von Erkenntnis – wenn sie festgehalten werden.
Ergebnisse verallgemeinern. Was auf einer Seite funktioniert, gilt nicht automatisch für alle. Übertrage Erkenntnisse als Hypothese, nicht als Tatsache.
Was du testen solltest
Wenn die Methodik steht, bleibt die Frage nach dem Gegenstand. Priorisiere nach zwei Kriterien: erwartete Wirkung und Traffic auf der betroffenen Seite.
Erfahrungsgemäss liefern grosse Hebel die klarsten Ergebnisse: das Angebot selbst, der Umfang eines Formulars, die zentrale Botschaft, die Seitenstruktur, der Preis oder seine Darstellung.
Kleine Hebel – Farben, Formulierungsnuancen, Bildvarianten, erzeugen selten Effekte, die bei realistischen Datenmengen nachweisbar sind. Sie sind nicht wirkungslos, nur nicht messbar. Investier deine begrenzte Testkapazität deshalb dort, wo ein Unterschied gross genug ist, um überhaupt sichtbar zu werden.
Fazit
Ein guter A/B-Test beginnt lange vor dem Start, mit einer Hypothese aus Daten, einer berechneten Stichprobengrösse und einem festgelegten Endzeitpunkt.
Ändere eine Sache pro Test, lass ihn mindestens zwei Wochen laufen und brich nicht ab, weil eine Variante zwischenzeitlich führt. Miss möglichst nah am Geschäftsziel und dokumentiere auch die Tests, die nichts gebracht haben. Und wenn dein Traffic für belastbare Tests nicht reicht, sei ehrlich damit, Scheinsicherheit ist schlechter als eine bewusste Entscheidung ohne Test.
Quelle: Searchengineland.com
Über die Autorin

Lisa-Marie Unger
Lisa-Marie hat 2018 Publizistik und Kommunikationswissenschaften abgeschlossen und arbeitet bei netpulse AG als Projektleiterin für Google Ads. Sie informiert über SEO (Suchmaschinenoptimierung) und führt Schulungen durch.



