Statystyka — podstawowe pojęcia i pułapki
Statystyka to nauka o zbieraniu, opisie i wnioskowaniu z danych. Podstawowe miary to średnia, mediana i dominanta oraz miary rozrzutu, jak rozstęp i odchylenie standardowe.
Statystyka pozwala opisać duże zbiory danych kilkoma liczbami, ale ten sam mechanizm umożliwia manipulację. Poniżej podstawy i najczęstsze błędy interpretacji.
Miary położenia
- Średnia arytmetyczna — suma podzielona przez liczbę elementów
- Mediana — wartość środkowa po uporządkowaniu
- Dominanta — wartość najczęstsza
Każda opisuje „typową” wartość inaczej i przy danych z wartościami skrajnymi mogą się znacznie różnić.
Miary rozrzutu
- Rozstęp — różnica między największą a najmniejszą wartością
- Odchylenie standardowe — przeciętne odchylenie od średniej
Sama średnia nie wystarcza do opisu danych. Zbiory 50, 50, 50 oraz 0, 50, 100 mają tę samą średnią, ale zupełnie inny rozrzut — bez tej drugiej informacji obraz jest niepełny.
Etapy badania statystycznego
- Określenie populacji i cechy badanej
- Dobór próby
- Zebranie danych
- Opracowanie i prezentacja
- Wnioskowanie
Najsłabszym ogniwem jest zwykle dobór próby. Ankieta przeprowadzona wśród czytelników jednego portalu opisuje tych czytelników, a nie ogół społeczeństwa, niezależnie od liczby odpowiedzi.
Korelacja to nie przyczynowość
Najważniejsza zasada interpretacji. Fakt, że dwie wielkości zmieniają się razem, nie oznacza, że jedna wywołuje drugą.
Sprzedaż lodów rośnie równolegle do liczby utonięć, ale lody nie topią ludzi — obie wielkości zależą od trzeciego czynnika, czyli upałów. Takie ukryte zmienne stoją za większością pozornych zależności.
Populacja i próba
Badanie całej populacji, czyli spis powszechny, jest kosztowne i rzadko wykonalne. Dlatego statystyka opiera się na próbie — podzbiorze, z którego wnioskuje się o całości. Kluczowa jest przy tym reprezentatywność, a nie sama liczebność.
Dobrze dobrana próba tysiąca osób daje trafniejszy obraz niż źle dobrana próba stu tysięcy. Klasycznym przykładem błędu jest sondaż przedwyborczy z 1936 roku w Stanach Zjednoczonych, oparty na dwóch milionach ankiet rozesłanych do posiadaczy telefonów i samochodów. Prognoza okazała się całkowicie błędna, bo w ówczesnych realiach grupa ta nie odzwierciedlała ogółu wyborców. Wielkość próby nie naprawia błędu doboru — powiela go tylko na większą skalę.
Jak wykresy wprowadzają w błąd
Najczęstszy zabieg to obcięcie osi pionowej. Wykres słupkowy zaczynający się nie od zera, lecz od wartości bliskiej danym, powiększa różnice wizualnie — wzrost o dwa procent może wyglądać na podwojenie.
Drugi zabieg to dobór zakresu czasowego. Ten sam szereg danych pokazany za pięć lat i za pięć miesięcy potrafi sugerować przeciwne wnioski, jeśli wybrać odpowiedni początek. Przy czytaniu wykresu warto więc najpierw sprawdzić skalę osi i zakres, a dopiero potem patrzeć na kształt.