Matek érettségi

Kérdőív mintanagysága és hibahatára: mit jelent a 385 kitöltés?

Mintatervezés, Wilson-intervallum és a véletlen mintavétel korlátai: két számszerű példa, világos értelmezéssel.

Dajka Gábor6 perc olvasás

A szükséges kitöltésszámot a kutatási kérdés és a mintavétel módja együtt határozza meg. Egyetlen univerzális darabszám nem mondja meg, hogy a kérdőíved alkalmas-e következtetésekre. Arányt becsülsz, csoportokat hasonlítasz össze, vagy egy változás kimutatása a cél? Ezek eltérő tervezési feladatok.

A kérdőív-mintanagyság kalkulátor egy arány becsléséhez tervez mintát. A válaszadási arány és hibahatár kalkulátor már a beérkezett igen és nem válaszokból készít Wilson-intervallumot. Az egyik a kutatás előtti, a másik az adatgyűjtés utáni számítás. Az alábbi példák kitalált kutatási helyzetek, a számtani eredmények ellenőrizhetők az eszközökben.

Pontosan milyen kérdésre keresel választ?

Az aránybecsléshez egyértelműen meg kell mondanod, kit tekintesz a célcsoport tagjának, és mi számít igennek. Például egy meghatározott közösség tagjai közül hányan választanának egy adott időpontot. Az érvényes válaszok körét előre írd le: lehetnek hiányos kérdőívek, jogosulatlan válaszadók vagy ismételt kitöltések.

A mintaszám itt az értékelhető, az adott kérdéshez ténylegesen felhasználható válaszokra vonatkozik. Ötszáz megnyitás és ötszáz teljes válasz különböző mennyiség. Ha az egyik kérdést sokan kihagyják, annak aránybecslése kisebb mintára támaszkodik, mint a kérdőív többi része.

A Penn State mintatervezési anyaga külön tárgyalja a sokasági arány becsléséhez szükséges mintanagyságot és a véges célcsoport korrekcióját. A program ennek normálközelítéses tervezési logikáját használja. Összetett mintavételre, súlyozott adatokra vagy két csoport különbségének kimutatására további módszertani tervezés szükséges.

Első példa: 95%-os szint és öt százalékpont

Tegyük fel, hogy a célcsoport nagyon nagy, a várt igenarány ismeretlen, és 95%-os megbízhatósági szint mellett öt százalékpontos tervezett hibahatárt szeretnél. Ilyenkor az 50%-os előzetes arány óvatos választás: a p × (1 − p) szorzat itt a legnagyobb.

A nagy sokasághoz tartozó mintaszám képlete: n₀ = z² × p × (1 − p) / e². A kétoldali 95%-os szinthez z megközelítőleg 1,959964; p = 0,5; e = 0,05. Behelyettesítve 1,959964² × 0,5 × 0,5 / 0,05² = 384,1459. Felfelé kerekítve 385 érvényes válasz szükséges a megadott modellben.

Ha kézzel 1,96-tal számolsz, 384,16-ot kapsz. A két közelítés ugyanahhoz a 385 fős egész mintához vezet. A felfelé kerekítés szándékos: egy tört létszám lefelé kerekítése nem teljesítené pontosan a megadott tervezési feltételt.

Tegyük fel továbbá, hogy a megkeresettek 40%-ától vársz érvényes választ. A megkeresések becslése 385 / 0,4 = 962,5, felfelé kerekítve 963 fő. Ez tervezési átlagra épülő becslés. A tényleges kitöltési arány alacsonyabb is lehet, ezért a 963 megkeresés önmagában nem garantál 385 választ.

Mit változtat egy véges célcsoport?

Ha az előző példában pontosan 1000 fő alkotja a teljes célcsoportot, és abból egyszerű véletlen mintát veszel visszatevés nélkül, alkalmazható a véges sokasági korrekció. A képlet: n = n₀ / (1 + (n₀ − 1) / N). Az előző számokkal 384,1459 / (1 + 383,1459 / 1000) = körülbelül 277,7335, tehát 278 főre kerekítünk.

A 40%-os várható kitöltési aránnyal 278 / 0,4 = 695 megkeresés adódik. A kevesebb szükséges válasz oka, hogy a teljes közösségnek már számottevő részét megfigyeled. A célcsoport méretéhez annak teljes létszámát írd be. A közösségi bejegyzésedet követők száma csak akkor megfelelő, ha a kutatásod célcsoportja ténylegesen pontosan ez a kör.

A korrekció alkalmazása nem kezeli automatikusan, hogy kik hagyják ki a kérdőívet. Ha a válaszadás összefügg a vizsgált véleménnyel, a végső minta torzulhat. A meghívottak véletlen kiválasztása és a tényleges válaszadók összetétele külön ellenőrzési kérdés.

Második példa: 60 igen 100 válaszból

Most már lezárult egy másik, szemléltető felmérés. Száz érvényes válaszból hatvan igen, tehát a megfigyelt arány 60 / 100 = 0,6, vagyis 60%. A 95%-os Wilson-intervallumot a NIST módszertani leírása szerinti alakban számoljuk.

A közös nevező D = 1 + z² / n. A példában ez 1 + 3,841459 / 100 = 1,03841459. A Wilson-középpont a megfigyelt arány korrigált változata: (0,6 + 3,841459 / 200) / 1,03841459 = körülbelül 0,59630065.

A félszélesség számításához a gyök alatt 0,6 × 0,4 / 100 + 3,841459 / 40 000 szerepel. Ennek négyzetgyökét megszorozzuk 1,959964-gyel, majd elosztjuk a D nevezővel. Az eredmény körülbelül 0,09429806. A középpontból kivonva és hozzáadva 50,20% és 69,06% adódik.

Az intervallum a megfigyelt 60%-hoz képest lefelé körülbelül 9,80, felfelé 9,06 százalékpont. A két eltérés nem teljesen azonos. Ezért pontosabb a két határt kiírni, mint egy mesterségesen szimmetrikus plusz-mínusz értéket megadni. A kijelzett százalékokat két tizedesre kerekítettük.

Mit jelent itt a megbízhatóság?

A 95%-os szint az alkalmazott eljárás ismételt mintavételeknél vizsgált lefedettségére vonatkozik, a modell feltételei mellett. Egy elkészült intervallum esetében a sokaság valódi aránya rögzített, bár számodra ismeretlen. A megfogalmazás ezért legyen óvatos és pontos: a választott módszerrel számolt 95%-os intervallum határait közöld.

A Wilson-számítás nem szimmetrikus a megfigyelt arány körül, és akkor is ad bizonytalansági tartományt, ha minden válasz azonos. A nulla igen válasz egy kis mintában nem bizonyítja, hogy az egész célcsoportban lehetetlen az igen. Ezt az eszköz nulla igent tartalmazó példájával külön is kipróbálhatod.

A kalkulátor folytonossági korrekció és véges sokasági korrekció nélküli Wilson-intervallumot használ. A mintatervező véges célcsoportra korrigált eredményét ezért ne kezeld úgy, mintha ugyanaz a korrekció az eredményértékelőben is megjelenne. Nagy mintavételi hányadnál ezt a módszertani különbséget külön kell rendezni.

Miért kevés a sok kitöltés önmagában?

Az OpenStax mintavételi fejezete a kiválasztás módját és az ebből eredő torzításokat is tárgyalja. Egy nyílt, önkéntes internetes kérdőív kitöltői jellemzően saját döntéssel kerülnek a mintába. A válaszadás esélye eltérhet az emberek között.

Képzelj el egy olyan kérdést, amelyet kizárólag egy szakmai közösségben teszel fel, majd az eredményt az egész településre szeretnéd kiterjeszteni. A számítógép kiad egy intervallumot, de az el nem ért lakosokról ettől még nincs megfelelő mintavételi információd. A magas darabszám ezt a hiányt nem írja felül.

A teljes minta és az alcsoportok elemszámát is válaszd szét. Ha összesen 385 válaszod van, abból egy szűk csoportba esetleg csak néhány tucat ember tartozik. Az ő arányuk bizonytalanságát a saját csoportlétszámuk alapján kell vizsgálni. A teljes minta hibahatárát nem lehet minden részcsoportra változatlanul ráírni.

Mit rögzíts az eredmény mellé?

Írd le a célcsoportot, a kiválasztás módját, az adatfelvétel időszakát, az érvényes válaszok számát és az alkalmazott intervallum módszerét. Tedd egyértelművé, hogy a hibahatárt százalékpontban érted. A százalék és a százalékpont különbségét a százalékos változás kalkulátorával is ellenőrizheted.

Előbb tervezd meg, hogyan éred el a megfelelő embereket. Ezután számold ki a szükséges válasz- és megkeresésszámot. Az adatgyűjtés végén a ténylegesen értékelhető mintából készíts intervallumot, és a korlátokat az eredménnyel együtt közöld. Ettől lesz a számítás visszakövethető.

Források

További cikkek

Kapcsolódó olvasnivalók

Gyorskereső

Kalkulátorok és útmutatók keresése

↑↓ választásEnter megnyitásEsc bezárás