Istotność to jedno z tych słów, które w statystyce robi więcej zamieszania, niż powinno. W języku potocznym istotny oznacza: ważny, istotny, mający znaczenie.
W statystyce? Nie.
Istotność statystyczna nie oznacza, że efekt jest ważny. Oznacza, że zaobserwowany efekt byłby trudny do wyjaśnienia samą losową zmiennością, gdyby w rzeczywistości efektu nie było.
Istotność praktyczna oznacza, że wielkość efektu jest na tyle duża, że ma znaczenie dla procesu, produktu, kosztu, jakości itd.
To zasadnicza różnica. I bardzo łatwo o niej zapomnieć, szczególnie podczas analizy wyników DoE. Przeprowadzamy eksperyment i analizujemy wyniki. Patrzymy na p-value i przykładowo widzimy p < 0,05, więc efekt jest statystycznie istotny. I pojawia się pokusa, żeby wyciągnąć wniosek: mamy ważny czynnik.
Niekoniecznie.
Tak naprawdę mamy czynnik, którego efekt jest statystycznie wykrywalny przy danych i założeniach, z którymi pracujemy. Nadal jednak nie wiemy, czy ten efekt jest istotny praktycznie. Wyobraźmy sobie, że zmiana czynnika A z poziomu niskiego na wysoki powoduje średnią zmianę odpowiedzi o 0,2 jednostki, przy p-value równym 0,001.
Statystycznie? Bardzo przekonujące.
Ale jeżeli z punktu widzenia procesu interesują nas wyłącznie zmiany o wielkości co najmniej 5 jednostek, to te 0,2 jednostki może nie mieć żadnego praktycznego znaczenia. I odwrotnie. Efekt może być duży i potencjalnie bardzo użyteczny do optymalizacji procesu, ale przy małej liczbie obserwacji i wysokim poziomie zaklóceń możemy nie uzyskać p < 0,05.
Załóżmy, że badamy wpływ zmiany temperatury z poziomu niskiego na wysoki na wytrzymałość materiału i otrzymujemy p = 0,27. Bardzo łatwo napisać: Temperatura nie ma wpływu na wytrzymałość. Ale p = 0,27 wcale nam tego nie mówi.
Poprawny wniosek jest znacznie skromniejszy: w tym eksperymencie nie uzyskaliśmy wystarczających dowodów, aby odrzucić hipotezę o braku efektu temperatury. To nie jest semantyczny detal. To fundamentalnie inne stwierdzenie.
Być może temperatura rzeczywiście nie ma wpływu na wytrzymałość albo być może próba była zbyt mała, poziom zakłóceń zbyt wysoki, zakres między poziomami temperatury zbyt wąski, system pomiarowy niewystarczająco dobry albo eksperyment miał po prostu zbyt małą moc, żeby wykryć efekt, który rzeczywiście istnieje. I właśnie tutaj pojawia się bardzo ważne rozróżnienie:
brak dowodu – nie potrafiliśmy wykazać efektu
to nie to samo co:
dowód na brak – mamy wystarczająco dobre dane, aby wykazać, że efekt nie istnieje albo jest na tyle mały, że nie ma dla nas praktycznego znaczenia.
Ten drugi wniosek wymaga czegoś więcej niż p > 0,05.
Najpierw musimy odpowiedzieć na znacznie bardziej praktyczne pytanie: jak duży efekt miałby dla nas znaczenie? Dopiero wtedy możemy ocenić, czy nasze dane są wystarczające, aby wykluczyć efekt tej wielkości. Dlatego dwie pozornie proste interpretacje p-value są błędne: p < 0,05 nie mówi nam, jak ważny jest efekt. p > 0,05 nie mówi nam, że efektu nie ma.
Pierwsza myli istotność statystyczną z istotnością praktyczną. Druga myli brak dowodu z dowodem na brak. I być może właśnie dlatego słowo istotność zrobiło w statystyce więcej zamieszania, niż powinno.
Dlatego w DoE nie interesuje mnie wyłącznie: czy efekt jest istotny statystycznie? Interesuje mnie również, a często przede wszystkim: jak duży jest efekt?
Bo p-value nie jest miarą wielkości efektu. Nie mówi nam, ile zyskamy. Nie mówi nam, czy poprawa ma znaczenie technologiczne. Nie mówi nam, czy zmiana ustawienia procesu jest warta kosztu.
Istotność statystyczna i praktyczna po prostu odpowiadają na inne pytania.
Być może lepszym określeniem niż statystycznie istotny byłoby statystycznie wykrywalny. Wtedy znacznie trudniej byłoby pomylić potrafię wykryć efekt z ten efekt rzeczywiście ma znaczenie.
Statystycznie istotny ≠ praktycznie istotny, a celem eksperymentu nie jest znalezienie p-value < 0,05. Celem jest zrozumienie związku przyczynowo-skutkowego i podjęcie lepszej decyzji.