CWPCentrum Wiedzy Psychologicznej
Wszystkie teksty
Student3 października 20269 min czytania

Rzetelność i trafność testu: czym się różnią?

Test może dawać powtarzalne wyniki i wciąż mierzyć nie to, co trzeba. Wyjaśniamy rzetelność i trafność na prostych przykładach, z rodzajami, alfą Cronbacha i pułapkami z egzaminu z psychometrii.

Autor: Redakcja CWP

Rzetelność i trafność testu: czym się różnią?

Kolokwium z psychometrii za tydzień. W notatkach masz „rzetelność: dokładność pomiaru” i „trafność: czy test mierzy to, co ma mierzyć”, a mimo to w teście próbnym zaznaczasz odpowiedź „test jest rzetelny, czyli mierzy to, co ma mierzyć” i tracisz punkt. Rzetelność i trafność to dwa pojęcia, które brzmią podobnie, pojawiają się zawsze razem i dlatego najłatwiej je pomylić. Tymczasem odpowiadają na zupełnie inne pytania o test.

W tym tekście rozkładamy oba pojęcia na części: czym są, jakie mają rodzaje, jak się je sprawdza i gdzie egzaminatorzy najczęściej zastawiają pułapki. Bez wzorów tam, gdzie nie są potrzebne, i z przykładami, które łatwo zapamiętać.

Psychometria to dla Ciebie głównie wzory i definicje? W szkoleniu Psychometria dla studenta psychologii masz mapę rodzajów rzetelności i trafności na jednej stronie, fiszki pojęć do wycięcia i lekcje, w których każde obliczenie jest liczone krok po kroku. Dostęp w planie Student.

Rzetelność i trafność w jednym zdaniu

Najkrócej: rzetelność mówi, jak dokładnie test mierzy, czyli na ile wynik jest wolny od błędu losowego. Trafność mówi, czy test mierzy to, co ma mierzyć, i czy wnioski, które wyciągamy z wyniku, mają uzasadnienie.

Klasyczny przykład z wykładów to waga łazienkowa, która zawsze pokazuje o dwa kilogramy za dużo. Ważysz się trzy razy i trzy razy widzisz ten sam wynik. Pomiar jest powtarzalny, więc rzetelny. Ale jest systematycznie przesunięty, więc nietrafny. Odwrotnej sytuacji nie da się zbudować: waga, która przy każdym ważeniu pokazuje coś innego, nie może trafnie mierzyć masy ciała.

Stąd zasada, którą warto znać na pamięć: rzetelność jest warunkiem koniecznym, ale niewystarczającym trafności. Test może być rzetelny i nietrafny, ale nie może być trafny bez rzetelności.

Czym jest rzetelność testu?

Punktem wyjścia jest klasyczna teoria testów i jej podstawowe równanie: X = T + E. Wynik otrzymany (X) to suma wyniku prawdziwego (T) i błędu pomiaru (E). W grupie osób przekłada się to na wariancje: zróżnicowanie wyników otrzymanych to suma zróżnicowania prawdziwego i zróżnicowania błędu.

Rzetelność testu definiuje się jako stosunek wariancji prawdziwej do wariancji otrzymanej. Przyjmuje wartości od 0 do 1. Współczynnik 0,80 oznacza, że osiemdziesiąt setnych zróżnicowania wyników w grupie to prawdziwe różnice między ludźmi, a reszta to szum.

Dwie rzeczy, które często pojawiają się na egzaminie:

  • współczynnika rzetelności nie podnosi się do kwadratu, bo on sam jest już proporcją wariancji prawdziwej; do kwadratu podnosi się zwykłą korelację dwóch różnych zmiennych, na przykład współczynnik trafności,
  • ściśle biorąc, rzetelność jest właściwością wyników w danej grupie, a nie testu „w ogóle”; ten sam test w jednorodnej grupie studentów jednego kierunku może dać niższą rzetelność niż w zróżnicowanej próbie dorosłych.

Rodzaje rzetelności: alfa Cronbacha, test-retest i inne

Błąd pomiaru ma różne źródła, dlatego istnieje kilka sposobów szacowania rzetelności. Każdy odpowiada na inne pytanie:

  • zgodność wewnętrzna: czy pozycje testu mierzą to samo? Należą tu metoda połówkowa z korektą wzorem Spearmana-Browna, alfa Cronbacha, dla pozycji punktowanych zero-jedynkowo KR-20, a coraz częściej także omega McDonalda,
  • stabilność, czyli test-retest: czy wyniki są podobne przy powtórnym badaniu po pewnym czasie?
  • równoważność wersji równoległych: czy dwie wersje testu dają podobne wyniki?
  • zgodność sędziów: czy różni oceniający przyznają podobne wyniki?

Na egzaminie bardzo często pada pytanie, którą metodę wybrać w danej sytuacji. Klucz jest zawsze ten sam: najpierw zapytaj, jakie źródło błędu jest najważniejsze dla tego testu i tego zastosowania. Przykład: niska korelacja test-retest w kwestionariuszu nastroju nie świadczy o słabym teście, bo nastrój jest stanem, który ma się zmieniać. Dla miar stanów ważniejsza jest zgodność wewnętrzna.

Co alfa Cronbacha mówi, a czego nie mówi

Alfa to najczęściej raportowany współczynnik w pracach studenckich i jednocześnie najczęściej źle rozumiany. Warto pamiętać, że:

  • alfa rośnie z liczbą pozycji, więc długa skala ze słabo powiązanymi pozycjami może mieć alfę wyglądającą przyzwoicie,
  • wysoka alfa nie dowodzi jednowymiarowości; skala złożona z dwóch skorelowanych wymiarów też może mieć wysoką alfę, a strukturę sprawdza się analizą czynnikową,
  • bardzo wysoka alfa nie zawsze cieszy, bo może oznaczać, że pozycje są niemal swoimi kopiami,
  • w pracy rocznej czy magisterskiej podaje się alfę z własnych danych, a nie tylko z podręcznika testu.

Jak opisać narzędzia i ich rzetelność w rozdziale metodologicznym, pokazujemy w tekście o tym, jak napisać pracę magisterską z psychologii.

Błąd standardowy pomiaru: rzetelność w wyniku jednej osoby

Współczynnik rzetelności opisuje test w grupie, a psychologa w diagnozie interesuje konkretna osoba. Tu wchodzi błąd standardowy pomiaru (SEM), czyli typowa wielkość, o jaką wynik otrzymany różni się od prawdziwego. Liczy się go ze wzoru: SEM = SD × pierwiastek z (1 - r). Im wyższa rzetelność, tym mniejszy błąd i węższy przedział ufności wokół wyniku osoby.

To dlatego przyjmuje się umowną regułę, że do badań porównujących grupy wystarcza niższa rzetelność niż do decyzji o jednej osobie. W porównaniu grup błędy pojedynczych osób częściowo się znoszą, a w decyzji o jednej osobie uderzają w nią w całości. Konkretne wartości graniczne podawane w podręcznikach traktuj jako konwencję, nie jako sztywną normę.

Czym jest trafność testu?

Jeśli rzetelność to dokładność, trafność testu to sens pomiaru. Wszyscy autorzy zgadzają się, że trafność jest najważniejszą właściwością testu, bo dokładny pomiar niewłaściwej rzeczy jest bezużyteczny, a czasem szkodliwy.

Rodzaje trafności w ujęciu klasycznym

W połowie XX wieku utrwalił się podział na trzy rodzaje, nazywany czasem „trójcą”:

  • trafność treściowa: czy pozycje testu są reprezentatywną próbką zakresu treści lub zachowań, które test ma obejmować,
  • trafność kryterialna: czy wyniki wiążą się z zewnętrznym kryterium; dzieli się ją na diagnostyczną, gdy kryterium mierzy się w tym samym czasie, i prognostyczną, gdy mierzy się je później,
  • trafność teoretyczna, czyli trafność konstruktu: czy test mierzy teoretyczny konstrukt, co sprawdza się, testując przewidywania wynikające z teorii, na przykład trafność zbieżną i różnicową.

Osobno wymienia się trafność fasadową, czyli to, czy test wygląda na związany z cechą w oczach badanych. Uwaga: to wrażenie, a nie dowód. Trafność treściowa wymaga systematycznej oceny ekspertów według planu testu.

Ujęcie współczesne: jedna trafność, wiele dowodów

Od drugiej połowy XX wieku coraz mocniej przyjmuje się ujęcie jednolite, kojarzone przede wszystkim z Samuelem Messickiem. Trzy „rodzaje” trafności traktuje się w nim jako trzy rodzaje dowodów na jedno i to samo. Trafność nie jest właściwością testu, tylko właściwością interpretacji i zastosowań wyników. Ten sam test może być trafny do jednego celu i nietrafny do innego. Do trafności należą też konsekwencje stosowania testu.

Najbezpieczniejsza odpowiedź na egzaminie na polecenie „omów trafność” łączy obie perspektywy: najpierw klasyczne trzy rodzaje z polskimi nazwami, potem uwaga, że współcześnie traktuje się je jako źródła dowodów jednej trafności, a na koniec zdanie, że trafność to zawsze trafność do czegoś: do określonego celu, w określonej populacji.

Najwięcej punktów ucieka na zadaniach i pytaniach „porównaj”. Szkolenie Psychometria dla studenta psychologii kończy się modułem powtórkowym z lekcją o typowych pułapkach (w tym rzetelność a trafność) i zestawem 50 pytań i zadań egzaminacyjnych z rozwiązaniami: SEM, przedział ufności, wzór Spearmana-Browna i przeliczanie wyników.

Rzetelność a trafność: najczęstsze pułapki na egzaminie z psychometrii

Na egzaminie z psychometrii pytania często sprawdzają nie to, czy znasz definicje, ale czy odróżniasz podobne pojęcia. Oto pary, które warto przećwiczyć:

  1. „Test jest rzetelny, czyli mierzy to, co ma mierzyć.” Fałsz. To definicja trafności. Rzetelność dotyczy dokładności.
  2. „Błąd systematyczny obniża rzetelność.” Fałsz. Błąd systematyczny powtarza się w każdym pomiarze, więc uderza w trafność. Rzetelność obniża błąd losowy.
  3. „Rzetelność 0,80 oznacza, że 0,64 wariancji to wariancja prawdziwa.” Fałsz. Rzetelności nie podnosi się do kwadratu. Do kwadratu podnosi się współczynnik trafności.
  4. „Wysoka alfa dowodzi, że skala mierzy jeden konstrukt.” Fałsz. Alfa mówi o spójności, nie o strukturze.
  5. „Test ma trafność treściową, bo pytania wyglądają na związane z cechą.” Fałsz. To trafność fasadowa.
  6. „Trafność diagnostyczna to trafność w diagnozie klinicznej.” Fałsz. Diagnostyczna i prognostyczna różnią się czasem pomiaru kryterium, a nie kontekstem.

Jedno zdanie, które porządkuje całość: błąd losowy uderza w rzetelność, błąd systematyczny w trafność, a rzetelność ogranicza trafność od góry. Wynik z dużym błędem losowym nie może silnie korelować z żadnym kryterium.

Jak sprawdzić rzetelność i trafność w praktyce?

Gdy dobierasz kwestionariusz do pracy rocznej albo czytasz podręcznik testu, zadawaj kilka pytań:

  • jakie metody szacowania rzetelności podano i czy pasują do mierzonej cechy (stała cecha czy zmienny stan),
  • w jakiej grupie liczono rzetelność i czy przypomina ona Twoją próbę,
  • jakie konkretne dowody trafności przedstawiono: treściowe, kryterialne, zbieżne i różnicowe, analiza struktury,
  • do jakiego celu test był sprawdzany i czy Twój cel jest taki sam,
  • czy normy są aktualne i reprezentatywne.

Zdanie „narzędzie ma wysoką trafność” bez wskazania dowodów to sygnał, żeby szukać dalej. Ta sama ostrożność przydaje się w diagnozie, o czym piszemy w tekście o tym, czym różni się wywiad od obserwacji w diagnozie psychologicznej, oraz przy analizie wyników, gdy zastanawiasz się, jak wybrać test statystyczny do pracy.

Psychometria krok po kroku, od wzoru do odpowiedzi na egzaminie

Rzetelność i trafność to serce psychometrii, ale na egzaminie dochodzą do nich konstrukcja testu, normy, skale standardowe i teoria odpowiedzi na pozycje. Szkolenie przeprowadza Cię przez cały przedmiot na prostych przykładach, a obliczenia pokazuje krok po kroku na zmyślonych danych.

  • 10 modułów i 40 lekcji, łącznie około 30 godzin materiału
  • mapa rodzajów rzetelności i trafności oraz fiszki pojęć psychometrycznych do wycięcia
  • ściągawka skal standardowych z wzorami i przykładem przeliczenia
  • karta oceny podręcznika testu i szablon opisu narzędzia oraz rzetelności w pracy
  • 50 pytań i zadań egzaminacyjnych z psychometrii z rozwiązaniami

Zobacz program szkolenia i zacznij powtórkę z psychometrii →

Najczęściej zadawane pytania

Czym różni się rzetelność od trafności?

Rzetelność mówi, jak dokładnie test mierzy, czyli na ile wynik jest wolny od błędu losowego. Trafność mówi, czy test mierzy to, co ma mierzyć, i czy wnioski z wyniku są uzasadnione.

Czy test może być rzetelny, ale nietrafny?

Tak. Przykładem jest waga, która zawsze pokazuje o dwa kilogramy za dużo: wyniki są powtarzalne, ale przesunięte. Odwrotnie się nie da, bo test bez rzetelności nie może być trafny.

Jakie są rodzaje rzetelności?

Zgodność wewnętrzna (metoda połówkowa, alfa Cronbacha, KR-20, omega), stabilność mierzona metodą test-retest, równoważność wersji równoległych i zgodność sędziów. Każdy rodzaj szacuje inne źródło błędu pomiaru.

Jakie są rodzaje trafności?

W ujęciu klasycznym trafność treściowa, kryterialna (diagnostyczna i prognostyczna) oraz teoretyczna. Współcześnie traktuje się je jako różne źródła dowodów jednej trafności, odnoszącej się do interpretacji wyników.

Co oznacza alfa Cronbacha?

To współczynnik zgodności wewnętrznej, który mówi, na ile pozycje skali są ze sobą spójne. Nie dowodzi jednowymiarowości i rośnie wraz z liczbą pozycji, dlatego warto go interpretować ostrożnie.

Jaka rzetelność testu jest wystarczająca?

Nie ma jednej wartości granicznej, bo zależy to od celu pomiaru. Do porównań grup w badaniach zwykle akceptuje się niższą rzetelność niż do decyzji o konkretnej osobie, a wartości podawane w podręcznikach są umownymi regułami.

Co to jest błąd standardowy pomiaru?

To typowa wielkość, o jaką wynik otrzymany różni się od wyniku prawdziwego. Liczy się go z odchylenia standardowego i współczynnika rzetelności, a służy do wyznaczenia przedziału ufności dla wyniku jednej osoby.

Newsletter

Nowe teksty i nowości z biblioteki CWP

Jedna wiadomość, gdy pojawi się coś wartego uwagi: nowe szkolenia i ścieżki, nowe teksty na blogu, zmiany w regulacji zawodu. Bez ofert w każdym mailu.

Powiązane szkolenia

Szkolenia, które rozwijają ten temat

Dostęp w ramach subskrypcji — bez opłat za pojedyncze szkolenie.

Blog

Przeczytaj także

3 października 2026

Jak zrobić analizę w JASP krok po kroku?

Masz dane z ankiety i otwarty JASP, ale nie wiesz, od czego zacząć? Prowadzimy przez całą analizę: wczytanie danych, typy zmiennych, statystyki opisowe, alfę Cronbacha, test t i korelację, aż po opis wyników w stylu APA.

9 min czytania

3 października 2026

Czym zajmuje się psycholog kliniczny?

Diagnoza, konceptualizacja przypadku, pomoc i praca w zespole: pokazujemy, czym na co dzień zajmuje się psycholog kliniczny, gdzie pracuje, czym różni się od psychiatry i psychoterapeuty i jak wygląda droga do tej pracy.

8 min czytania