분산분석
분산분석은 여러 집단 평균의 차이를 집단 사이 변동과 집단 내부 변동으로 나누어 평가하는 통계 방법이다. F통계량, 요인과 상호작용, 사후비교와 모형 가정의 점검이 핵심이다.
문서 목차 · 개요
1. 개요
분산분석은 여러 집단 평균의 차이를 집단 사이 변동과 집단 내부 변동으로 나누어 평가하는 통계 방법이다.
F통계량, 요인과 상호작용, 사후비교와 모형 가정의 점검이 핵심이다.
분산분석은 복잡한 현상을 비교 가능한 언어로 정리하지만 현실 전체를 한 숫자로 대체하지 않는다.
정의와 가정, 자료의 범위와 적용 목적을 함께 이해해야 올바르게 사용할 수 있다.
2. 변동의 분해
분산분석에서 변동의 분해은 전체 관측의 변동을 집단 평균 차이와 집단 내부 차이로 나눈다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 세 교육방법의 점수를 비교할 때 방법 사이 차이와 학생 개인차를 구분한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 분해가 인과관계를 자동으로 뜻하지 않는다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
3. F통계량
분산분석에서 F통계량은 집단 사이 평균제곱을 집단 내부 평균제곱으로 나눈 비율이다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 귀무가설 아래 두 변동 추정이 비슷하면 비율이 1 주변에 놓인다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 큰 값은 적어도 한 평균이 다르다는 신호이지 어느 집단인지는 말하지 않는다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
4. 일원 분산분석
분산분석에서 일원 분산분석은 하나의 범주형 요인이 연속형 결과에 미치는 평균 차이를 다룬다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 세 지역의 평균 통근시간을 한 번에 비교한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 여러 번의 두 집단 검정보다 전체 오류율을 통제해야 한다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
5. 이원 분산분석
분산분석에서 이원 분산분석은 두 요인의 주효과와 두 요인이 함께 작용하는 상호작용을 평가한다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 교육방법 효과가 연령대에 따라 다른지 분석한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 상호작용이 크면 주효과 평균만으로 설명하면 안 된다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
6. 반복측정
분산분석에서 반복측정은 같은 대상을 여러 시점이나 조건에서 관찰한 의존성을 반영한다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 환자의 치료 전후와 추적 시점 점수를 비교한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 독립 관측으로 처리하면 표준오차가 잘못된다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
7. 사후비교
분산분석에서 사후비교은 전체 검정 뒤 어떤 집단 쌍이 다른지 다중비교 보정과 함께 살핀다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 네 집단의 여섯 쌍을 비교할 때 가족단위 오류율을 관리한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 전체 검정 없이 유리한 쌍만 선택하면 거짓 발견이 늘어난다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
8. 가정과 강건성
분산분석에서 가정과 강건성은 오차의 독립성, 분산 구조와 잔차 분포를 진단한다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 집단별 분산이 크게 다르면 Welch 방법을 고려한다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 정규성 검정 하나만으로 타당성을 결정하지 않는다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
9. 효과 크기
분산분석에서 효과 크기은 유의성 외에 요인이 설명하는 변동 비율과 실제 평균 차이를 제시한다.
이 개념은 숫자 하나를 계산하는 절차에 그치지 않고 자료나 시장이 만들어진 조건을 설명하는 역할을 한다.
분석자는 대상, 기간, 단위와 비교 기준을 먼저 정하고 어떤 가정 아래 관계를 해석하는지 밝혀야 한다.
예를 들어 표본이 크면 작은 평균 차이도 유의할 수 있어 에타제곱을 함께 본다.
사례의 결과를 다른 집단이나 시점에 적용하려면 측정 방식과 제도가 같은지 확인해야 한다.
평균적인 관계가 모든 개인과 기업에 똑같이 나타난다고 단정해서도 안 된다.
해석할 때는 설명분산이 실무 중요성과 동일하다고 단정하지 않는다.
관련 지표 하나만 보고 결론을 내리면 원인과 결과를 뒤바꾸거나 중요한 분포 차이를 놓칠 수 있다.
대안 설명, 불확실성, 자료의 누락과 장단기 조정을 함께 검토해야 한다.
실무 보고서에는 사용한 정의와 자료 출처, 계산 기준, 제외 규칙과 결과가 달라지는 조건을 기록한다.
이렇게 해야 다른 사람이 같은 절차를 재현하고 새로운 자료가 들어왔을 때 판단을 갱신할 수 있다.
10. 적용과 검토
용어를 실제 문제에 적용할 때는 먼저 질문을 측정 가능한 대상으로 바꾼다.
누구의 어떤 변화인지, 비교 기준은 무엇인지, 관찰 기간과 단위는 무엇인지 정하지 않으면 같은 표현도 서로 다른 계산을 뜻할 수 있다.
자료가 많다는 사실은 정확성을 자동으로 보장하지 않는다.
특정 집단의 누락, 잘못된 측정, 정의 변경과 선택 편향은 표본이나 거래 수가 커져도 남는다.
자료 생성 과정과 제도적 배경을 계산 결과보다 먼저 점검해야 한다.
수치의 방향뿐 아니라 크기와 불확실성을 함께 본다.
작은 변화가 많은 사람에게 적용되면 중요할 수 있고 큰 평균 변화도 소수의 극단값에 의해 만들어질 수 있다.
평균, 중앙값, 분포와 하위집단 결과를 함께 제시하는 것이 좋다.
관찰된 관계만으로 인과관계를 단정하지 않는다.
공통 원인, 역인과, 기대와 동시적인 정책 변화가 결과에 섞일 수 있다.
무작위 설계, 자연실험, 비교 집단이나 시간 순서를 이용해 대안 설명을 줄여야 한다.
모형은 현실을 단순화한 도구다.
가정이 달라졌을 때 결과가 얼마나 변하는지 민감도 분석을 하고, 특정 방법에서만 결론이 나타나면 그 불안정성을 공개한다.
탐색 과정에서 많은 비교를 했다면 우연한 발견 가능성도 고려한다.
좋은 설명은 용어의 정의, 계산 방법, 사례와 한계를 연결한다.
숫자를 권위처럼 제시하기보다 무엇을 알게 되었고 무엇은 아직 알 수 없는지 구분할 때 통계와 경제 개념이 책임 있는 판단 도구가 된다.