Test statystyczny do pracy z psychologii wybierasz, odpowiadając na cztery pytania: czy szukasz różnic, czy związków, na jakiej skali mierzysz zmienne, ile masz grup lub pomiarów i czy dane spełniają założenia testów parametrycznych. Kiedy znasz te odpowiedzi, wybór zwykle zawęża się do jednego lub dwóch testów. Kluczowe jest to, żeby decyzję podjąć przed analizą, na podstawie hipotez, a nie po obejrzeniu wyników.
Poniżej znajdziesz prosty schemat decyzji, najczęściej stosowane testy w pracach studenckich i błędy, o które najczęściej pytają promotorzy i recenzenci.
Krok 1: różnice czy związki?
Każda hipoteza w pracy z psychologii sprowadza się zwykle do jednego z dwóch typów pytań.
- Pytanie o różnice: czy grupy różnią się pod względem jakiejś zmiennej? Na przykład: czy studenci pierwszego i piątego roku różnią się poziomem lęku przed egzaminem?
- Pytanie o związki: czy dwie zmienne współwystępują? Na przykład: czy wyższa samoocena wiąże się z niższym poziomem lęku?
To rozróżnienie wydaje się proste, ale warto je zapisać przy każdej hipotezie osobno. W jednej pracy często są hipotezy obu typów, a każda wymaga innej analizy.
Jest też trzecia, bardziej zaawansowana kategoria: przewidywanie, czyli pytanie, na ile jedna lub kilka zmiennych pozwala przewidzieć wynik innej. Tu wchodzi w grę regresja. W pracach licencjackich pojawia się rzadziej, w magisterskich częściej.
Krok 2: na jakiej skali mierzysz zmienne?
Skala pomiaru decyduje o tym, jakie operacje matematyczne mają sens. Na zajęciach ze statystyki poznajesz cztery skale:
- Nominalna: kategorie bez porządku, np. płeć, kierunek studiów, miejsce zamieszkania.
- Porządkowa: kategorie uporządkowane, ale odstępy między nimi nie muszą być równe, np. wykształcenie, pozycja w rankingu.
- Przedziałowa: równe odstępy, brak naturalnego zera, np. wyniki wielu skal psychologicznych traktowane jako przedziałowe.
- Ilorazowa: równe odstępy i naturalne zero, np. czas reakcji, liczba błędów.
W praktyce badań psychologicznych skale przedziałowa i ilorazowa są często traktowane łącznie jako ilościowe. Warto pamiętać, że pojedyncze pytanie z odpowiedziami od „zdecydowanie nie” do „zdecydowanie tak” to formalnie skala porządkowa. Sumaryczny wynik kilkunastu takich pytań w skali kwestionariuszowej bywa już traktowany jako ilościowy. To częsty temat dyskusji z promotorem, więc warto umieć uzasadnić swoje podejście.
Krok 3: ile grup i jaki układ?
Przy pytaniach o różnice liczy się liczba porównywanych grup lub pomiarów oraz to, czy są one niezależne, czy zależne.
- Grupy niezależne: różne osoby w każdej grupie, np. kobiety i mężczyźni, studenci stacjonarni i niestacjonarni.
- Grupy zależne (powtarzane pomiary): te same osoby mierzone kilka razy, np. przed i po warsztacie, albo pary dopasowane.
Z tego wynika podstawowa mapa testów różnic dla zmiennej zależnej mierzonej ilościowo:
- dwie grupy niezależne: test t dla prób niezależnych, a jego odpowiednik nieparametryczny to test U Manna-Whitneya,
- dwa pomiary tych samych osób: test t dla prób zależnych albo test Wilcoxona,
- trzy i więcej grup niezależnych: jednoczynnikowa analiza wariancji (ANOVA) albo test Kruskala-Wallisa,
- trzy i więcej pomiarów tych samych osób: ANOVA z powtarzanym pomiarem albo test Friedmana.
Gdy obie zmienne są nominalne, na przykład chcesz sprawdzić, czy rozkład odpowiedzi „tak/nie” różni się między grupami, zwykle stosuje się test chi-kwadrat niezależności.
Testy związków
Dla pytań o związki podstawowy wybór wygląda tak:
- korelacja r Pearsona: obie zmienne ilościowe, związek w przybliżeniu liniowy, rozkłady bez poważnych odchyleń,
- korelacja rho Spearmana: gdy co najmniej jedna zmienna jest porządkowa albo nie są spełnione założenia korelacji Pearsona,
- chi-kwadrat (i miary siły związku dla tabel): gdy obie zmienne są nominalne.
Krok 4: czy spełniasz założenia testów parametrycznych?
Testy parametryczne, takie jak test t czy ANOVA, opierają się na założeniach. Najczęściej sprawdza się:
- rozkład zmiennej zależnej w grupach, czyli czy nie odbiega poważnie od rozkładu normalnego,
- jednorodność wariancji między grupami,
- niezależność obserwacji, czyli to, że wynik jednej osoby nie wpływa na wynik innej,
- brak skrajnych wartości odstających, które mogą zniekształcać średnie.
Jeśli założenia są naruszone, masz zwykle kilka opcji: wybrać odpowiednik nieparametryczny, zastosować wersję testu odporną na nierówne wariancje albo, po konsultacji z promotorem, przekształcić dane. Ważne, żeby w pracy opisać, co sprawdziłeś i dlaczego podjąłeś taką decyzję.
Liczebność grup ma tu znaczenie. Przy małych i bardzo nierównych grupach naruszenia założeń bardziej zniekształcają wyniki, dlatego wtedy ostrożniej podchodzi się do testów parametrycznych.
Najczęstsze błędy przy wyborze testu
- Wybór testu po obejrzeniu wyników. Jeśli najpierw liczysz kilka testów, a potem raportujesz ten „istotny”, zwiększasz ryzyko fałszywie pozytywnego wniosku. Plan analiz powinien powstać przed ich wykonaniem.
- Wiele testów t zamiast ANOVA. Porównywanie trzech grup parami kilkoma testami t zwiększa ryzyko błędu. Przy trzech i więcej grupach zaczyna się od analizy wariancji, a porównania szczegółowe robi się potem, z odpowiednią korektą.
- Traktowanie grup zależnych jak niezależnych. Pomiar „przed i po” na tych samych osobach wymaga testu dla prób zależnych.
- Wnioski przyczynowe z korelacji. Istotna korelacja nie mówi, co jest przyczyną, a co skutkiem. Może też wynikać z trzeciej zmiennej.
- Sama wartość p bez wielkości efektu. Wynik istotny statystycznie może być bardzo mały i praktycznie bez znaczenia. Warto raportować miary wielkości efektu i interpretować je obok wartości p.
- Brak opisu założeń. Recenzent chce wiedzieć, że sprawdziłeś warunki stosowania testu, nawet jeśli wynik był zgodny z oczekiwaniami.
Jak opisać wybór testu w pracy i na obronie
W rozdziale metodologicznym lub na początku wyników dobrze jest krótko uzasadnić analizę. Wystarczy kilka zdań w logice: jakie pytanie, jaka skala, jaki układ, jakie założenia, jaki test. Na przykład: „Aby sprawdzić, czy grupy różnią się poziomem lęku, zastosowano test t dla prób niezależnych, po sprawdzeniu rozkładu zmiennej i jednorodności wariancji”.
Na obronie komisja często pyta: „Dlaczego ten test, a nie inny?”. Jeśli potrafisz przejść przez cztery kroki z tego artykułu, masz gotową odpowiedź. Pomaga też narysowanie sobie prostego drzewa decyzyjnego i trzymanie go przy notatkach z seminarium.
Jeśli chcesz przećwiczyć te decyzje na przykładach, od statystyk opisowych przez test t, chi-kwadrat i ANOVA po drzewo wyboru testu, zajrzyj do szkolenia Statystyka dla studentów psychologii – bez strachu i od podstaw. Pomaga ono zrozumieć logikę analiz, a nie tylko klikać w programie.
Najczęściej zadawane pytania
Kiedy użyć testu t, a kiedy ANOVA?
Test t stosuje się do porównania dwóch grup lub dwóch pomiarów, a analizę wariancji, gdy grup lub pomiarów jest trzy i więcej. Przy trzech grupach nie robi się serii testów t, bo każde kolejne porównanie zwiększa ryzyko fałszywego wyniku. ANOVA sprawdza najpierw, czy w ogóle występują różnice między grupami, a porównania szczegółowe wykonuje się potem, z odpowiednią korektą. Obie metody wymagają zmiennej zależnej mierzonej ilościowo i spełnienia założeń.
Czym różnią się testy parametryczne od nieparametrycznych?
Testy parametryczne, takie jak test t czy ANOVA, zakładają m.in. określony rozkład zmiennej i jednorodność wariancji, a porównują zwykle średnie. Testy nieparametryczne, takie jak test Manna-Whitneya czy Wilcoxona, mają mniej wymagające założenia i opierają się najczęściej na rangach. Stosuje się je przy danych porządkowych lub gdy założenia testów parametrycznych są wyraźnie naruszone. Wybór warto uzasadnić w pracy.
Czy skala Likerta to dane porządkowe czy ilościowe?
Pojedyncze pytanie z odpowiedziami na skali Likerta to formalnie skala porządkowa, bo nie wiadomo, czy odstępy między odpowiedziami są równe. Sumaryczny lub średni wynik wielu pytań tworzących skalę kwestionariuszową jest w badaniach psychologicznych często traktowany jako zmienna ilościowa. To kwestia dyskutowana w metodologii, dlatego warto ustalić podejście z promotorem i krótko je uzasadnić w części metodologicznej pracy.
Jaki test wybrać do porównania wyników przed i po?
Gdy te same osoby są mierzone dwa razy, na przykład przed i po warsztacie, potrzebny jest test dla prób zależnych. Przy zmiennej ilościowej i spełnionych założeniach jest to test t dla prób zależnych, a gdy założenia są naruszone lub dane są porządkowe, zwykle test Wilcoxona. Przy trzech i więcej pomiarach stosuje się analizę wariancji z powtarzanym pomiarem albo test Friedmana. Kluczowe jest, żeby nie traktować tych pomiarów jak niezależnych grup.
Co zrobić, gdy dane nie mają rozkładu normalnego?
Najpierw oceń, jak duże jest odchylenie i jaka jest liczebność grup, bo przy większych próbach wiele testów parametrycznych jest dość odpornych na umiarkowane odchylenia. Jeśli odchylenie jest wyraźne, a grupy małe, możesz wybrać odpowiednik nieparametryczny albo, po konsultacji z promotorem, zastosować przekształcenie danych. W pracy opisz, jak sprawdzałeś rozkład i dlaczego wybrałeś takie rozwiązanie.
Czy wynik nieistotny statystycznie oznacza, że pracy nie da się obronić?
Nie. Wynik nieistotny statystycznie jest pełnoprawnym wynikiem, który trzeba rzetelnie opisać i omówić w dyskusji. Może wynikać z rzeczywistego braku efektu, zbyt małej próby, ograniczeń narzędzi lub specyfiki badanej grupy. Komisja ocenia przede wszystkim poprawność projektu, analizy i interpretacji. Poważnym błędem byłoby natomiast szukanie innych testów tylko po to, żeby uzyskać wynik istotny.