Die erste Skalierungsregel lautet: nichts ohne Belege optimieren. Wir instrumentieren das reale System und messen Antwortzeiten je Endpoint, teure Abfragen, ausgelastete Verbindungen und Warteschlangen.
Bei vielen Systemen stammt der größte Teil des Problems aus drei Engpässen. Caching übernimmt wiederholte Lesezugriffe, einige Indizes oder überarbeitete Abfragen entlasten die Datenbank, und schwere Aufgaben wie E-Mail- oder Medienverarbeitung verlassen die Nutzeranfrage.
Erst danach ergänzen wir Kapazität durch Lesereplikate, vertikale oder horizontale Skalierung und ein CDN. Aus dem Bauch heraus sind diese Entscheidungen teuer; mit Messdaten werden sie eindeutig.
Vor der erwarteten Spitze testen wir mit der doppelten Ziellast und beobachten, was zuerst ausfällt. Eine kontrollierte Umgebung am Dienstagnachmittag zu brechen ist besser, als das Produktionslimit am Montagmorgen zu entdecken.
Typischerweise trägt dieselbe Softwarearchitektur deutlich mehr Verkehr, ohne dass die Serverkosten derselben Kurve folgen.


