제7주 표본의 추출
표본의 추출 (The Logic of Sampling)
표집의 추출은 관찰의 대상을 선정하는 과정
확률표본추출 - 무작위 표본추출로서 비교적 적은 수의 샘플로 모집단의 특성을 일반화하여 추론하는것을 가능하게 한다.
표집추출의 논리 (The Logic of Probability Sampling)
만약 모집단의 성분이 완전히 동일하다면 1개의 표집으로 충분히 모집단을 설명할 수 있다. 그러나 모집단의 성분이 다양한 경우 모집단에서 추출한 표본을 가지고 모집단의 특성을 가능한한 정확하게 묘사하는 방식을 취한다. 이때 이 묘사의 정확도를 향상시켜줄 수 있는 방법이 확률표본추출방법.
확률표본추출의 논리 - 모집단의 모든 요소가 표집에 추출될 확률을 동등하게 가지고 있는 상태에서 표집이 추출된 경우 이표집은 대표성이 있다고 한다. 무작위 추출방법이 확률표본추출의 핵심이 되며 이렇게 추출된 표본은 어떤 다른 종류의 표본보다도 대표성이 있다. 편견이 최대한 배제되기 때문. 확률이론은 샘플의 정확도나 대표성을 측정할 수 있다.
난수표이용방법: random table number
예)980명의 모집단중 100명을 추출한다고 가정할 때
1. 모집단 980에 번호를 부여한다.
2. 980명의 모집단이므로 3자리수의 random number가 필요하다. (11825명이 모집단이라면 5자리수의 random number가 필요하다)
3. 난수표에 5자리수의 번호가 있다.
4. 아무번호의 난수표 숫자를 고르되 왼쪽이나 오른쪽의 3자리수만 취한다. (예 난수표의 번호가 37542라면 이중 세자리수 375 혹은 542를 취한다)
5. 난수표상에서 오른쪽, 왼쪽, 대각선방향 어느방향으로나 이동하면서 4의 방식으로 일관되게 숫자를 택한다.
6. 시작점은 어디에서나 상관없다. (눈을 가리고 연필을 굴린다던지)
7. 980을 넘는 난숫자가 나오면 단순히 무시하고 다음으로. 같은 숫자가 나와도 무시.
8. 100명이 될때까지 계속
표본의 크기가 커질수록 모집단의 평균 (통계치)을 추정하기 위한 표본분포의 질은 향상된다. (표본의 크기가 커질수록 표본분표의 분산은 작아지고 true mean에 가까워진다)
확률이론은 표본분포에 대한 주요한 이론을 제공해 준다.
1. 모집단에서 무작위로 표본이 추출될때 이러한 표본들의 통계치는 모집단의 통계치를 중심으로 일정한 형태의 분포를 보인다.
2. 확률이론은 표본의 통계치가 모집단의 참통계치(true mean or statistics)에 얼마나 근사하게 접근해 있는지를 알수있게하는 공식을 제공한다. (표준오차: standard error: Babbie:151). 이 표준오차는 표본의 통계치가 모집단의 참통계치에 어느정도나 근접하여 분포될지를 나타내 주는 중요한 정보를 제공한다.
SE=
(표준오차=0 if P=0 or 1. SE=almost zero if n=무한대)
where P=the population parameters for the binominal. P=1-Q
모집단과 sampling frame
sampling frame은 확률표본이 추출되는 준모집단(quasi-list of elements from population)을 말한다.
이는 표본추출단위가 수록된 목록을 말하는 것이다.
예를 들면 전화번호부 같은 것이 표본추출 프레임의 예가 된다.
그런데 표본추출프레임은 표본추출에 들어가기전에 면밀히 검토되어야 한다.
만약 전화번호부를 유권자를 표본으로 추출하기 위한 표본추출프레임으로 사용한다고 하면 이때 발생할 수 있는 문제는 1)전화를 보유하지 않고 있는 유권자는 표본추출프레임에서 누락되어 있다 2)전화는 유권자별로 가입되어 있는 것이 아니라 가구별로 가입하기 때문에 전화번호부는 구성요소목록이 아니라 집락목록에 해당한다. 3)연령이 미달된 사람과 회사등 모집단의 구성요소가 아닌 단위가 포함되어 있다. 따라서 유권자를 표본으로 뽑기 위한 표본추출프레임으로 전화번호부는 좋은 프레임이라 할 수 없다.
표본추출의 종류
1.단순무작위추출 - 표본의 준모집단을 설정한 후 모든 요소에 일련번호를 부여. 난수표를 사용하여 표집추출.
2.체계적추출 (systematic sampling) - 리스트에서 매 i번째의 요소를 추출. 첫번째만 무작위추출. 그러나 만약 리스트의 요소들이 어떤 체계에 의하여 나열되어 있는 경우 체계추출을 사용하면 대표성과 무작위성이 상실된다.
3. 층별추출(stratified sampling) -
모집단을 보다 동질적인 몇 개의 층(strata)으로 나누고 -이때 각 층간은 이질적이다- 이러한 각 층으로부터 단순무작위방법으로 표본을 추출한다.
포본의 더 높은 대표성을 확보하기 위하여 사용. 모집단의 동질적인 소모집단으로부터 적당한 크기의 표본을 추출. 예를 들어 대학생연구에서 학년별로 몇 명씩 표본을 선정하는 방법
예: 대학생에 대한 설문조사
학생등록카드
층화(stratification)-학급단위(class) (더많은 층화가 필요한 경
우- 성별, 주전공, 대학등)
체계적포본의 추출
주의점:
층화기준이나 변수는 분석대상이 되는 변수 또는 이것과 밀접한 관계를 갖는 것이어야 한다. 가령 학년별로 대학생의 독서량을 조사하려 할 때는 학년이 층화기준이 되어야지 성별이나 년령이 기준이 되어서는 안된다
또, 층화기준은 이것을 사용함으로써 층안에서는 내적으로 동질성이 확보되고 각 층간의 차이는 되도록 크게 되는것을 선택하는 것이 좋다.
1)비례층화추출(proportional stratified sampling)
각층이 점하는 비례에 따라 각 층의 크기를 할당하여 추출하는 방법
예: 대학 학생수의 남여비가 90:10이라면 성별에 의한 층화일 경우 남자 90%, 여자 10%로 추출
모집단의 특성을 파악하는데 유리하다.
2)비비례층화추출(nonproportional stratified sampling)
각층의 크기와 상관없이 같은수의 표본을 뽑는방법.
예) 앞의 예에서 학생수가 5000명이면 비례층화추출은 남자 450명 여자 50명, 비비례층화추출인 경우 남여 200명
4 군집추출(집락추출: cluster sampling)
일반적으로 지역이 집락이 되는 경우가 보통. 광범위한 지역전체에서 표본을 추출하는 것이 아니라 몇개의 지역을 추출, 이 지역내에서만 표본을 추출하는 방법이다. 예를 들어 서울시민의 공무원에 대한 인식을 조사하는 경우 먼저 洞을 무작위로 추출한 다음 이 洞에서 표본을 선정하는 것
모집단을 수개의 집단으로 분류한다는 점에서 군집추출과 층화추출은 동일하다. 그러나 표본을 선정하는 방법이 대조적이다. 층화추출은 모든 부분집단에서 표본이 추출되지만 집락추출은 추출된 부분집단에서만 표본을 추출한다. 이는 층화추출은 부분집단간은 이질적이나 부분집단내는 동질적이라고 가정하는 반면 집락추출은 부분집단내는 이질적인 요소로 이루어져 있으나 부분집단간에는 대체로 비슷하다고 전제하기 때문이다(김해동, 1993:272-3).
5. 다단계군집추출 (multistage cluster sampling) - 리스트의 획득이 어려운 경우 (시민, 도, 전국의 인명, 전국의 대학생, 전국의 교회인명부등). - 리스팅과 표본의 추출과정을 반복한다. 그러나 덜 정확한 표본을 초래한다. 단계가 많아 질수록 표집오차가 발생. 그러나 대표성은 향상된다. --> 단계의 최대화, 각 군집내의 표집요소의 수를 최소화. blolck -> household -> sample persons within each selected household
예를 들어 우리나라 국민의 거주관에 관한 조사에서 먼저 시도를 무작위로 선출하고 추출된 시도에서 군과 구를, 또 여기에서 읍면동을 선정한 다음 여기에 비치된 주민등록부를 목록표로 활용하여 표본을 무작위로 선정한다(김해동, 1993:274).
비확률포본추출
1. 판단추출 (purposive or judgemental sampling) - 설문지의 타당도를 검사하기 위한 전실험단계에서 사용. 학생운동의 지도자들을 연구할때. 투표행태의 연구에서 전체지역과 비슷한 결과를 보인 지역만을 선정.
2. 할당추출 (Quota sampling) - 연구대상의 모집단의 특성을 파악(남자의 비율, 나이분포, 교육정도, 인종별분표등) 할당된 표본의 수를 연구자의 판단에 의하여 임의적으로 추출하기 때문에 비확률표본추출이다.
3. 편의추출
4. 누적표본추출(snowball sampling)
표본크기의 결정
모집단의 규모가 크면 상대적으로 표본의 크기도 크게하는 것이 바람직하다.
그러나 표본의 크기가 모집단의 크기에 비레하지는 않는다.
미국의 경우, 여론조사 표본의 크기는 2천명 내외이며, 우리나라 성인을 대상으로한 여론 조사에서 표본의 크기는 대체로 1500명 정도
표본의 크기
표본평균의 95% 신뢰도구간을
이고 이때
S=모집단의 표준편차, e=표본평균의 허용가능한 오차 (95% 신뢰도수준에서 e=5%)
S를 모르는 경우,
h=max-min 일 때,
장방형 균일분포이면 σ=0.29h,
좌우대칭 이등변 삼각형 모습의 분포이면 σ=0.24h,
한쪽으로 편포가 이루어지면 σ=0.21h (홍두승, 86-87)
통계분석의 관점에서 표본수는 최저 30개
교차표를 작성하여 조사를 하는 경우 각 셀의 크기는 최소 5개의 사례.
신뢰도의 수준은 보통 ±1.96 정도