(번역) 29가지 통계 개념 - 회귀분석의 가정과 조건들

회귀분석을 실행하기 위해 필요한 가정과 조건들에 대해 알아보자.

회귀분석에 필요한 가정과 조건들

회귀분석은 데이터셋에서 패턴을 찾는 것에 굉장히 유용한 방법이다. 하지만 항상 데이터를 회귀선에 적합할 수 있는 것은 아니다. SPSS 나 Excel 같은 대부분의 소프트웨어는 회귀선이 말이 되지 않더라도 최적의 회귀선을 항상 제공해준다. 해당 데이터가 회귀분석에 적합한지를 미리 알아내는 것은 분석가에게 달려있다. 그렇다면 어떻게 할 수 있을까? 검정을 실행하기에 앞서 아래의 가정과 조건들을 만족하는지를 알아봄으로써 이를 판단할 수 있다:

데이터는 정량적(Quantitative) 이어야 한다.
데이터가 직선에 가깝게 분포해야 한다(선형회귀일 경우에만 해당).
이상치가 없어야 한다.
오차는 서로 독립적(Independent)이어야 한다.
오차항은 모든 독립변수 값에 대하여 동일한 분산(Homoscedasticity)을 갖는다.
오차항의 분포는 정규성(Normality)을 가져야 한다.

정량적 데이터 조건 / 정량적 변수 조건

회귀분석은 오직 정량적인 데이터에만 적용할 수 있다. 다시 말하자면, 데이터가 숫자가 아니라면 회귀분석은 경향을 파악하는 데에 좋은 방법은 아닐지도 모른다. 변수들이 실제 단위를 가지고 있고, 의미있는 것을 측정하는지를 확인하라.

데이터가 이러한 조건을 만족하는지 확인하기 위해서는 가지고 있는 데이터가 정성적인 데이터(Qualitative data)가 아니라 정량적인 데이터(수치형 자료)인 것을 확인하라. 정성적인 자료는 범주로 나눌 수 있는 데이터(그래서 범주형 데이터라고도 한다)를 의미한다. 정량적인 자료와 정성적인 자료: 변수들을 구분하는 방법 을 참고하라.

정량적인 형태를 띄고 있는 범주형 변수

가끔 통계학에서는 범주형 자료에 숫자들을 할당해서 정량적 자료로 만들기도 한다(연산을 할 수 있게 만들기 위해서). 예를 들어, 카드 한 덱은 정량적인 변수(카드의 갯수)와 정성적인 변수(모양: 하트, 다이아몬드, 스페이드, 클럽)로 이루어져 있다. 이를 정량적으로 만들기 위해서 각 모양(suits)에 숫자를 부여할 수도 있다.

하트 = 1
다이아몬드 =2
스페이드 = 3
클럽 = 4

하지만 범주형 자료에 숫자를 부여했다고 해서 이를 정량적 변수로 만들어주지는 못한다. 이들은 여전히 숫자로 이루어진 범주형 자료이다. 이 변수는 정량적 변수의 조건을 만족시키지 못하기 때문에 이러한 종류의 변수에는 회귀분석을 사용할 수 없다.

선형성 가정 (Assumption of Linearity)

선형성은 선형 회귀분석에서만 해당되는 가정이다. 회귀선은 데이터가 어느 정도 선형을 띄지 않는다면 굉장히 잘못된 결과를 알려줄 수도 있다. 이를 확인할 수 있는 최선의 방법은 산점도를 그려보는 것이다. 만약 데이터를 한 직선을 그어서 적합할 수 있게 보이면 회귀분석을 적용할 수 있다. 다른 종류의 회귀분석(지수 회귀분석 같은) 을 적용하는 경우에는 동일하게 산점도를 눈으로 살펴보고 이 산점도가 수행하려고 하는 회귀분석의 모양과 비교해보라.

이상치 조건

the outlier condition

하나의 이상치가 회귀선에 큰 영향을 줄 수도 있다

이상치는 회귀분석을 진행할 때 회귀직선과 상관 계수에 엄청나게 큰 영향을 줄 수 있다. 만약 데이터에 이상치가 존재한다면 회귀분석을 진행할 때, 이를 포함해서 한번, 제거하고 한번, 총 두 번을 진행해보는 것이 좋다.

오차항의 독립성 (Independence of Errors)

만약 데이터가 명확한 패턴을 띈다면, 이는 오차들이 서로 영향을 주는 것을 의미한다고도 할 수 있다. 오차는 관측값과 예측값의 차이를 말한다. 아래의 그림은 두 선형회귀 직선을 나타내는데, 왼쪽의 그림에서 데이터는 회귀선 주위에 임의적으로 분포되어 있고, 오른쪽의 그림에서 데이터는 서로 명확하게 영향을 주고 있다.

independence of errors

만약에 오차가 무작위로 분포되어 있지 않는다면, 예측이 정확하지 않기 때문에 회귀분석을 진행할 수 없다.

오차항의 등분산성 (Homoscedasticity)

오차의 등분산성은 데이터가 회귀선 주위로 부채꼴이 아니라 동일한 범위 내에서 분포해야한다는 것이다. 이분산성(Heteroscedasticity) 란 오차항의 독립성과 마찬가지로, 오차에서 어떤 경향을 볼 수 있다는 것인데, 여기서 차이점은 그 경향이 커지거나 작아진다는 것이다. 아래의 그림을 보면 처음 두 그림은 $x$ 값에 따라서 오차의 분포가 커지거나 작아지는 경향을 보여주지만, 세 번째 그림은 그 값에 상관없이 오차가 특정 범위 내에서 무작위로 분포되어 있는 것을 볼 수 있다.

homoscedasticity and heteroscedasticity

오차항의 정규성

이 가정은 모든 $x$ 값에 대해서 데이터가 회귀선을 기준으로 정규분포를 따르게 분포되어야 한다는 것이다. 즉, 회귀선을 기준으로 그 주위에 더 많은 데이터가 있고, 이상치가 없이 균일하게 퍼져있어야 한다.

출처

Assumptions and Conditions for Regression

2025 9
2023 5
2022 1
2020 7
2019 24

2025

실험 기간을 좀 더 늘리면 안 돼요?

4 minute read

실험을 한 번 진행했는데 통계적으로 유의하지 못한 결과를 얻었습니다. 기간을 조금 더 두고 실험을 하자니 시간이 오래 걸릴 것 같은데 기존 결과를 그대로 포함해서 실험 기간을 늘려서 보면 안 되나요?

A/B 테스트가 통계학을 망치고 있다

2 minute read

A/B 테스트란 무엇이고, 제가 왜 이게 통계학을 망치고 있다고 생각하는지 설명드리고자 합니다.

(번역) AI 가 우리에게 다가오고 있다

5 minute read

이 글은 AI가 데이터베이스에 직접 접근해 인간 전문가처럼 데이터를 분석하는 새로운 워크플로우를 소개합니다. 단순한 질의응답을 뛰어넘는 이러한 도약은 데이터 분석가의 역할이 근본적으로 재정의될 미래를 암시합니다.

(번역) 넷플릭스 게임 사용자의 모험

2 minute read

이 글은 넷플릭스 (Netflix) 에서의 분석 엔지니어링 (Analytics Engineering) 관련 업무의 범위를 공유하기 위한 여러 편의 글 중 두 번째 글이며, 최근에 열렸던 분석 엔지니어링 컨퍼런스에서 발표된 내용이기도 합니다. 더 많은 내용이 궁금하신가요? 첫 번째 ...

(번역) 듀오링고의 그로스 모델에 대한 오해

4 minute read

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 3

10 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델 들어가기에 앞서

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 2

7 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델 들어가기에 앞서

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 1

8 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델

(번역) 의미있는 지표 (데이터로 제품팀이 집중해야할 것을 뾰족하게 만든 방법)

11 minute read

원문: Meaningful metrics: How data sharpened the focus of product teams

2023

(번역) Booking.com 에서의 축차 검정 (Sequential Testing)

19 minute read

원문: Sequential Testing at Booking.com

영어랑 친해지는 방법

7 minute read

가장 좋은 방법은 당연히 영어 밖에 사용하지 못하는 환경에 강제로 처해지는 것이겠지만 그것이 어려우니…

신입 데이터 분석가를 꿈꾸는 분들에게

3 minute read

고민의 흔적을 보여주세요

데이터 트래킹 기깔나게 잘 하는 방법

4 minute read

을 찾습니다.

(번역) Testing Product Ideas Handbook

6 minute read

소개

2022

(번역) 차트와 접근성

4 minute read

원문: Charts & Accessibility

2020

모수, 큰 수의 법칙, 그리고 중심극한정리

3 minute read

모수, 큰 수의 법칙, 그리고 중심극한정리에 대하여

(번역) 내가 COVID-19 데이터를 시각화하지 않는 이유

12 minute read

그리고 여러분들도 (아마도) 하지 않아야 하는 이유

사내 스터디에 대한 회고

2 minute read

회사 서비스의 추천 시스템을 개선하기 위해 팀 내에서 (아직까진 두 명이긴 하지만) 지난 두 달 동안 스터디를 진행했습니다. 얼마 전 두 번째 스터디가 끝났고 이에 대한 회고를 해보려고 합니다.

(번역) 데이터의 어두운 면 - 개인정보 (Dark Side of Data:Privacy)

6 minute read

원문: Dark Side of Data: Privacy by Emre Rencberoglu

(번역) 초보자를 위한 RStudio 의 프로젝트 와 작업 디렉토리

9 minute read

원문: RStudio Projects and Working Directories: A Beginner’s Guide by Martin Chan

(번역) Tidy Tuesday 이벤트에 대한 소개

3 minute read

원문: TidyTuesday GitHub Repository

(번역) 프로그래밍 언어들의 이름을 지은 방법

4 minute read

1 minute read

이 자료는 데이터 과학과 관련된 특정 주제에 대한 연재물이며, 다룰 주제는 다음과 같다. 회귀분석, 군집화, 신경망, 딥러닝, 의사결정나무, 앙상블, 상관관계, 파이썬, R, 텐서플로우, SVM, 데이터 축소, 피쳐 선택, 실험 계획법, 교차검증, 모델 피팅 등. 이 글을 계속 받...