A/B-Test-Rechner (Signifikanz)
Zwei Varianten mit einem Zwei-Stichproben-z-Test vergleichen: Conversion-Raten, Steigerung, p-Wert und Konfidenzintervall, mit vollständig gezeigtem Rechenweg.
Variante A (Kontrolle)
Variante B (Herausforderer)
Beide Varianten eingeben, um den Unterschied zu testen
Besuche und Conversions für A und B eingeben. Der Rechner führt einen Zwei-Stichproben-z-Test für Anteile durch und zeigt p-Wert, Konfidenzintervall und den Rechenweg.
Alles wird im Browser berechnet. Eingaben werden weder hochgeladen noch gespeichert.
Weiteres Tool ausprobieren
Passend zu diesem Tool ausgewähltDer A/B-Test-Rechner prüft, ob der Unterschied zwischen zwei Varianten einer Seite, einer Anzeige oder eines Newsletters statistisch belastbar ist. Für Variante A und B werden Besuche und Conversions eingetragen. Der Rechner führt einen Zwei-Stichproben-z-Test für Anteile durch und zeigt Conversion-Raten, den absoluten Unterschied in Prozentpunkten, die relative Steigerung, den p-Wert und das Konfidenzintervall. Der Rechenweg lässt sich aufklappen, und Warnhinweise erscheinen, wenn die Stichprobe für den Test zu klein ist. Alles läuft im Browser.
So funktioniert das Tool
- 01Daten eintragenFür beide Varianten die Besuche und die Conversions aus demselben Zeitraum eingeben.
- 02Niveau und Richtung wählenKonfidenzniveau von 90, 95 oder 99 Prozent und zweiseitigen oder einseitigen Test festlegen, am besten schon vor dem Test.
- 03Ergebnis lesenSignifikanz, p-Wert und Konfidenzintervall ablesen und den Rechenweg bei Bedarf aufklappen.
Wann ist das nützlich?
- Landingpages vergleichenZwei Überschriften, Bilder oder Formularlängen gegeneinander testen.
- Newsletter-BetreffzeilenÖffnungs- oder Klickraten zweier Betreffzeilen vergleichen, wenn beide an ähnlich große Gruppen gingen.
- AnzeigenvariantenPrüfen, ob eine neue Anzeige wirklich besser konvertiert oder nur zufällig vorne liegt.
Beispiele
- Signifikanter UnterschiedA: 4.820 Besuche, 241 Conversions (5,00 %). B: 4.790 Besuche, 287 Conversions (5,99 %). Mit z ≈ 2,13 und p ≈ 0,033 ist das bei 95 Prozent signifikant, das Konfidenzintervall reicht von etwa 0,08 bis 1,90 Prozentpunkten.
- Große Steigerung, zu wenig DatenJe 1.000 Besuche mit 50 und 60 Conversions sind 20 Prozent relative Steigerung, aber p ≈ 0,33: nicht signifikant.
- Kleine Steigerung, viel TrafficJe 20.000 Besuche mit 1.000 und 1.100 Conversions ergeben nur 10 Prozent Steigerung, mit p ≈ 0,025 aber ein signifikantes Ergebnis bei 95 Prozent.
Tipps für ein besseres Ergebnis
- Stichprobe vorher festlegenDen Test nicht beenden, sobald das Ergebnis signifikant aussieht. Wer ständig nachschaut, findet zufällige Unterschiede häufiger, als das Konfidenzniveau verspricht.
- Einseitig nur mit BegründungEin einseitiger Test halbiert den p-Wert, wenn B vorne liegt. Er ist nur zulässig, wenn vorher feststand, dass allein eine Verbesserung von B zählt.
- Ganze Wochen testenDas Verhalten schwankt zwischen Werktagen und Wochenende. Volle Wochen gleichen das aus.
Wie der Test rechnet
Unter der Nullhypothese haben beide Varianten dieselbe Conversion-Rate. Der Test schätzt sie aus allen Daten zusammen, die gepoolte Rate, berechnet daraus den Standardfehler des Unterschieds und teilt den beobachteten Unterschied durch diesen Fehler. Das Ergebnis ist der z-Wert. Aus ihm folgt über die Standardnormalverteilung der p-Wert: die Wahrscheinlichkeit, einen mindestens so großen Unterschied allein durch Zufall zu sehen, wenn es in Wahrheit keinen gibt.
p-Wert und Konfidenzintervall
Liegt der p-Wert unter 1 minus Konfidenzniveau, bei 95 Prozent also unter 0,05, gilt das Ergebnis als signifikant. Das Konfidenzintervall zeigt, in welchem Bereich der wahre Unterschied plausibel liegt. Es nutzt den ungepoolten Standardfehler, weil es einen tatsächlichen Unterschied schätzt. Schließt das Intervall die Null ein, ist der Unterschied nicht gesichert.
Wann der Test unzuverlässig wird
Der z-Test beruht auf einer Näherung an die Normalverteilung, und die braucht genug Ereignisse. Der Rechner warnt, wenn in einer Variante weniger als 5 Conversions oder Nicht-Conversions zu erwarten sind, wenn eine Variante weniger als 100 Besuche hat oder wenn eine Variante gar nicht konvertiert. Dann ist der p-Wert nur ein Anhaltspunkt.
Signifikanz ist nicht Relevanz
Mit genug Traffic wird fast jeder Unterschied signifikant, auch ein bedeutungsloser. Vor dem Test sollte deshalb feststehen, ab welcher Steigerung sich eine Änderung lohnt. Erst danach lässt sich die nötige Stichprobe sinnvoll planen.
Häufige Fragen
Ab wann ist ein A/B-Test signifikant?
Wenn der p-Wert unter der gewählten Schwelle liegt, bei 95 Prozent Konfidenz also unter 0,05. Dann ist ein so großer Unterschied allein durch Zufall unwahrscheinlich.
Was bedeutet der p-Wert?
Die Wahrscheinlichkeit, einen mindestens so großen Unterschied zu beobachten, wenn beide Varianten in Wahrheit gleich gut sind. Er ist nicht die Wahrscheinlichkeit, dass B besser ist.
Zweiseitig oder einseitig?
Zweiseitig ist der Standard und prüft Unterschiede in beide Richtungen. Einseitig nur, wenn vorher feststand, dass ausschließlich eine Verbesserung von B zählt.
Was sind Prozentpunkte?
Der absolute Abstand zwischen zwei Prozentwerten. Von 5 auf 6 Prozent ist 1 Prozentpunkt, aber 20 Prozent relative Steigerung.
Wie viele Besuche braucht ein Test?
Das hängt von der Ausgangsrate und der erwarteten Steigerung ab. Kleine Unterschiede brauchen viele tausend Besuche pro Variante, wie das Beispiel mit 20.000 Besuchen zeigt.
Werden meine Daten gespeichert?
Nein. Die Berechnung läuft im Browser, nichts wird hochgeladen.

