Zu wenig Traffic für einen A/B-Test? Was du stattdessen tust

Ein A/B-Test sagt dir, welche Seite besser abschneidet, mit einer bekannten Wahrscheinlichkeit, falsch zu liegen. Diese Garantie bezahlst du mit Besuchern. Hier ist die Rechnung, Schritt für Schritt, und was du tun kannst, wenn du die Besucher nicht hast.

Veröffentlicht am 2. Oktober 2026 · 5 Min. Lesezeit

Ein A/B-Test beantwortet eine Frage gut: welche von zwei Versionen einer Seite beim Durchschnittsbesucher besser abschneidet, mit einer bekannten Wahrscheinlichkeit, dass die Antwort falsch ist. Diese Garantie gibt es nicht gratis. Du bezahlst sie mit Besuchern, und die meisten neuen Seiten haben nicht genug davon.

Dieser Beitrag rechnet die Zahlen durch, damit du sie selbst nachprüfen kannst, und behandelt dann, was du tun kannst, wenn die Zahlen Nein sagen.

Die Rechnung

Die Standardberechnung für den Vergleich zweier Conversion-Raten braucht vier Eingaben: deine aktuelle Conversion-Rate, die verbesserte Rate, die du erkennen können willst, wie sicher du sein willst, dass ein erkannter Unterschied echt ist (Signifikanz), und mit welcher Wahrscheinlichkeit du die Verbesserung erkennen willst, wenn es sie wirklich gibt (Teststärke). Üblich sind 95 % Konfidenz und 80 % Teststärke.

Die Formel für die nötige Zahl an Besuchern pro Variante lautet:

n = (z_a + z_b)^2 × [p1 × (1 - p1) + p2 × (1 - p2)] / (p2 - p1)^2

p1  = aktuelle Conversion-Rate
p2  = die Rate, die du erkennen können willst
z_a = 1.95996  (95% Konfidenz, zweiseitig)
z_b = 0.84162  (80% Teststärke)

Nimm eine Conversion-Rate von 2 % und eine Verbesserung auf 2,4 %, also einen relativen Uplift von 20 %. Schritt für Schritt:

(z_a + z_b)^2           = (1.95996 + 0.84162)^2 = 7.8489
p1 × (1 - p1)           = 0.02 × 0.98   = 0.0196
p2 × (1 - p2)           = 0.024 × 0.976 = 0.023424
Summe                   = 0.043024
(p2 - p1)^2             = 0.004^2       = 0.000016

n = 7.8489 × 0.043024 / 0.000016 ≈ 21,106 pro Variante
Für diesen Beitrag berechnet. Andere übliche Varianten der Rechnung, etwa mit gepoolter Varianz oder Arkussinus-Transformation, liegen nur wenige Dutzend Besucher neben diesem Wert.

Also etwa 21.100 Besucher pro Variante, oder etwa 42.200 für einen einfachen Test mit zwei Varianten. Das müssen Besucher sein, die tatsächlich auf der getesteten Seite ankommen, nicht der gesamte Traffic der Website.

Was das in Zeit bedeutet, bei ein paar verschiedenen Traffic-Mengen:

Besucher der Seite pro WocheWochen bis etwa 42.200
500etwa 84
2.000etwa 21
10.000etwa 4

Und wie sich die Zahl bewegt, wenn sich die Eingaben ändern, mit derselben Formel:

Aktuelle RateZu erkennende RateBesucher pro Variante
2 %3 % (relativer Uplift von 50 %)etwa 3.800
2 %2,4 % (relativer Uplift von 20 %)etwa 21.100
2 %2,2 % (relativer Uplift von 10 %)etwa 80.700
10 %12 % (relativer Uplift von 20 %)etwa 3.800

Zwei Muster solltest du dir merken. Halbierst du den Uplift, den du erkennen willst, brauchst du ungefähr viermal so viele Besucher. Und eine höhere Ausgangsrate macht alles billiger, deshalb sind Tests auf einem Klick-Schritt lange vor Tests auf bezahlte Anmeldungen fertig. Du kannst deine eigenen Zahlen in die Formel oben eingeben oder in jeden Online-Stichprobenrechner für zwei Anteile.

Warum es nichts bringt, ihn trotzdem laufen zu lassen

Es ist verlockend, den Test einfach trotzdem laufen zu lassen und zu schauen, was passiert. Dabei geht zweierlei schief.

Ein Test mit zu geringer Teststärke kommt meist ohne signifikanten Unterschied zurück, selbst wenn eine Version wirklich besser ist, weil es nicht genug Daten gibt, um den Effekt vom Rauschen zu trennen. Du investierst Wochen und lernst nichts.

Schlimmer noch: Wenn ein solcher Test doch einen Gewinner verkündet, ist die gemessene Verbesserung tendenziell übertrieben. Bei wenig Daten kann nur eine große zufällige Schwankung die Signifikanzschwelle überschreiten, also überschätzen genau die Ergebnisse, die sie überschreiten, den wahren Effekt. Einen Test früh zu stoppen, sobald er signifikant aussieht, macht es noch schlimmer: Wer wiederholt nachschaut und beim ersten guten Ergebnis aufhört, treibt die Wahrscheinlichkeit eines falschen Gewinners weit über die 5 %, die er gewählt zu haben glaubte.

Was du stattdessen tun kannst

Keine der Alternativen unten liefert dir die saubere Antwort eines Tests mit ausreichender Teststärke. Sie liefern etwas anderes: eine gute Chance, große Probleme zu finden, und auf einer neuen Seite sind das meist die, auf die es ankommt.

Sprich mit Nutzern und schau ihnen zu. Ruf fünf Leute an, die zu deiner Zielgruppe passen. Frag nach dem letzten Mal, als sie das Problem hatten, dann teil deine Seite und bitte sie, beim Lesen laut zu denken. Probleme, an denen Leute hängen bleiben, zeigen sich meist schon in den ersten paar Gesprächen. Eine Conversion-Rate bekommst du so nicht, aber du hörst genau, wo die Seite sie verliert.

Mach Fünf-Sekunden- und First-Click-Tests. Zeig den ersten Bildschirm fünf Sekunden lang und frag, was das Produkt tut. Oder frag, wo die Person klicken würde, um eine bestimmte Aufgabe zu erledigen. Das geht von Hand mit ein paar Leuten aus deiner Zielgruppe oder mit einem der Dienste, die dafür gebaut sind.

Sieh dir Sitzungsaufzeichnungen an, nach Quelle getrennt. Nimm eine Traffic-Quelle und sieh dir zwanzig Aufzeichnungen daraus an. Achte darauf, wo Leute aufhören zu scrollen, was sie anklicken, das kein Link ist, und wo sie gehen. Maskiere Formulareingaben und prüf deine Einwilligungspflichten, denn je nachdem, wo deine Besucher sind, brauchen Aufzeichnungen womöglich eine Einwilligung.

Vergleiche vorher und nachher, aber sorgfältig. Ändere eine Sache, dann vergleiche einen festen Zeitraum nach der Änderung mit einem gleich langen Zeitraum davor, der dieselben Wochentage abdeckt. Führ ein datiertes Protokoll über jede Änderung. Sei ehrlich darüber, was das nicht kann: Die Mischung der Besucher ändert sich von Woche zu Woche, ein einziger Post, der irgendwo gut läuft, kann jede Zahl verschieben, und ein Vorher-Nachher kann deine Änderung nicht von allem anderen trennen, was in der Zeit passiert ist. Nutz es, um große Verschiebungen zu bemerken, lies es nach Quelle, und behandle kleine Unterschiede als Rauschen.

Wenn du testest, teste etwas Großes. Ein Test, der zwei verschiedene Angebote oder zwei wirklich verschiedene Seiten vergleicht, kann einen großen Effekt mit weit weniger Besuchern erkennen als ein Test von Buttonfarben. Und wenn ein früherer Schritt im Funnel eine höhere Rate hat, etwa Klicks auf den Haupt-Button, kommt er schneller zu einem Ergebnis, wie die Tabelle zeigt. Denk nur daran, dass eine Ersatzkennzahl nicht das Ziel ist: Mehr Klicks heißt nicht immer mehr Kunden.

Sieh Personalisierung als anderes Werkzeug. Personalisierung ändert, was jeder Besucher sieht, je nach Kontext, etwa woher er kam. Das kann eine vernünftige Wette sein, wenn deine Besucher mit unterschiedlichen Fragen ankommen, aber es ist eine Wette, die auf Überlegung beruht, nicht auf Evidenz. Sie sagt dir nicht, ob sie geholfen hat, und bei wenig Traffic könntest du das ohnehin nicht verlässlich messen. Wenn du sie nutzt, mach mit den qualitativen Prüfungen oben weiter.

Wenn du den Traffic hast

Teste. Ein A/B-Test mit ausreichender Teststärke ist die beste Evidenz, die eine Website bekommen kann, und nichts in diesem Beitrag ersetzt ihn. Der Vergleich IntentGrid vs. Optimizely behandelt, wann eine eigene Testing-Plattform die richtige Wahl ist, nämlich immer dann, wenn dein Traffic Tests in Wochen statt Monaten fertig werden lässt.

Der Transparenz halber: IntentGrid, das wir bauen, gehört in die letzte Kategorie der Liste oben. Es schreibt Text pro Besucher neu, es ist im Early Access, und es misst nichts.