A/B-Test Rechner
Ist dein Testergebnis echt oder Zufall? Prüfe die statistische Signifikanz zweier Varianten – mit p-Wert, Konfidenz und Uplift.
Kontrolle (A)
Variante (B)
Conversion Rate A
—
Conversions A ÷ Besucher A
Conversion Rate B
—
Conversions B ÷ Besucher B
Uplift (relativ)
—
(CVR B − CVR A) ÷ CVR A
Ergebnis
Trag die Zahlen beider Varianten ein, um die Signifikanz zu prüfen.
Benötigte Stichprobe planen
Wie viele Besucher du pro Variante brauchst – vor dem Test.
Benötigte Besucher pro Variante
—
Planungsgrösse bei 95 % Konfidenz und 80 % Power – vor dem Teststart.
Nächster Schritt
Conversion-Rate Rechner
Berechne die Conversion Rate deiner getesteten Variante.
Was ist statistische Signifikanz? Definition & Bedeutung
Statistische Signifikanz beantwortet die Frage, ob der Unterschied zwischen zwei Varianten echt ist oder nur Zufall. Wenn Variante B eine höhere Conversion Rate zeigt als A, kann das an einer echten Verbesserung liegen – oder schlicht daran, dass zufällig ein paar mehr Besucher gekauft haben. Ein Signifikanztest quantifiziert, wie wahrscheinlich das gemessene Ergebnis rein zufällig zustande käme. Erst wenn diese Wahrscheinlichkeit klein genug ist, solltest du auf Basis des Tests eine Entscheidung treffen.
Signifikanz berechnen – Z-Test & p-Wert
Der Rechner nutzt den Zwei-Proportionen-Z-Test (gepoolt). Aus den Conversion Rates p₁, p₂ und dem gepoolten Anteil p̂ ergibt sich ein z-Wert, aus dem über die Standardnormalverteilung der zweiseitige p-Wert folgt:
p̂ = (c₁ + c₂) ÷ (n₁ + n₂)
z = (p₂ − p₁) ÷ √( p̂(1−p̂) × (1/n₁ + 1/n₂) )
Je grösser |z|, desto unwahrscheinlicher ist der Unterschied ein Zufallsprodukt. Als Schwellen gelten |z| > 1,645 (90 %), |z| > 1,960 (95 %) und |z| > 2,576 (99 %). Der p-Wert übersetzt |z| in eine anschauliche Wahrscheinlichkeit.
A/B-Test-Signifikanz berechnen – Beispiel mit Zahlen
Kontrolle A: 10.000 Besucher, 200 Conversions. Variante B: 10.000 Besucher, 250 Conversions:
Mit p ≈ 0,017 liegt der Wert unter 0,05 – der Unterschied ist auf dem 95-%-Niveau signifikant. Bei 99 % Konfidenz (Schwelle z > 2,576) reicht z = 2,38 dagegen nicht: dasselbe Ergebnis wäre dann nicht signifikant.
Drei ehrliche Warnungen zur Signifikanz
- Nicht früh abbrechen («Peeking»): Wer den Test stoppt, sobald es kurz signifikant aussieht, produziert Scheinergebnisse. Lege Stichprobe und Laufzeit vorab fest und halte dich daran.
- Signifikant ≠ bedeutsam: Sehr grosse Stichproben machen selbst winzige, wirtschaftlich irrelevante Effekte signifikant. Umgekehrt übersehen zu kleine Tests echte Effekte. Schau immer auch auf die Grösse des Uplifts.
- 95 % Konfidenz heisst nicht 100 %: Im Schnitt zeigt 1 von 20 Tests ein Scheinergebnis, obwohl gar kein echter Unterschied besteht. Wichtige Ergebnisse lohnt es sich zu wiederholen.
Sauber testen: Stichprobe, Dauer & Disziplin
- Stichprobe vorab planen: Berechne mit dem Stichproben-Block oben, wie viele Besucher pro Variante nötig sind – bevor der Test startet, nicht danach.
- Volle Wochen laufen lassen: Beende Tests immer nach ganzen Wochen. Wochentag- und Wochenend-Effekte verzerren sonst das Ergebnis.
- Nur eine Änderung je Test: Änderst du mehrere Dinge gleichzeitig, weisst du am Ende nicht, welche den Unterschied gemacht hat.
Häufige Fragen
- Wann ist ein A/B-Test statistisch signifikant?
- Ein A/B-Test gilt als signifikant, wenn der p-Wert unter dem gewählten Schwellenwert liegt – üblich sind 5 % (95 % Konfidenz). Ein p-Wert von 0,017 bedeutet: Die Wahrscheinlichkeit, dass der gemessene Unterschied reiner Zufall ist, liegt bei nur 1,7 %. Dann darfst du davon ausgehen, dass Variante B wirklich anders wirkt als Variante A.
- Wie berechnet man die Signifikanz eines A/B-Tests?
- Über einen Zwei-Proportionen-Z-Test. Aus den Conversion Rates beider Varianten und den Besucherzahlen ergibt sich ein z-Wert: z = (p2 − p1) ÷ Standardfehler. Aus diesem z-Wert liest man den zweiseitigen p-Wert über die Standardnormalverteilung ab. Liegt der p-Wert unter 0,05, ist der Unterschied auf dem 95-%-Niveau signifikant.
- Wie viele Besucher braucht mein A/B-Test?
- Das hängt von deiner Baseline-Conversion-Rate und dem kleinsten Effekt ab, den du sicher erkennen willst. Je niedriger die Baseline und je kleiner der erwartete Effekt, desto mehr Besucher brauchst du. Der Stichproben-Rechner auf dieser Seite schätzt die nötige Besucherzahl pro Variante bei 95 % Konfidenz und 80 % Power – am besten planst du sie vor dem Teststart.
- Was bedeutet der p-Wert?
- Der p-Wert ist die Wahrscheinlichkeit, den beobachteten Unterschied (oder einen grösseren) allein durch Zufall zu erhalten, wenn es in Wirklichkeit gar keinen Unterschied gibt. Ein kleiner p-Wert spricht also gegen den Zufall. Wichtig: Der p-Wert sagt nichts über die Grösse oder wirtschaftliche Bedeutung des Effekts – nur darüber, wie gut er gegen den Zufall abgesichert ist.