스포츠 데이터

축구 득점은 왜 포아송 분포를 따를까: 스코어 확률표 직접 만들기

평균 득점 1.5와 1.1만 있으면 1-0, 1-1, 2-1이 나올 확률을 계산할 수 있습니다. 포아송 공식 P(k)=λ^k·e^-λ/k!로 스코어 확률표를 만들고, 무승부를 낮게 잡는 한계와 Dixon-Coles 보정까지 설명합니다.

투데이토토 편집팀 · · 수정 · 7분 읽기

축구 득점은 왜 포아송 분포를 따를까: 스코어 확률표 직접 만들기 — 스포츠 데이터
목차
  1. 포아송 분포는 어떤 상황을 설명하는가
  2. 공식 읽는 법: P(k) = λ^k · e^-λ / k!
  3. 가상의 두 팀으로 골 수별 확률 계산하기
  4. 포아송 모형의 한계: 무승부를 낮게 잡는다
  5. Dixon-Coles 보정의 개념
  6. 직접 해 볼 때의 체크리스트
  7. 자주 묻는 질문

축구 중계를 보다 보면 "이 팀은 경기당 평균 1.5골을 넣는다" 같은 말을 자주 듣습니다. 그런데 평균 1.5골이라는 숫자만으로는 이 팀이 무득점으로 끝날 가능성이 얼마인지, 세 골 이상 넣을 가능성이 얼마인지 알 수 없습니다. 평균을 "골 수별 확률"로 펼쳐 주는 도구가 바로 포아송 분포(Poisson distribution)입니다.

이 글에서는 포아송 공식이 무엇을 뜻하는지, 왜 축구 득점에 잘 맞는지 설명합니다. 이어서 가상의 두 팀 평균 득점을 넣어 스코어 확률표를 처음부터 끝까지 직접 계산합니다. 마지막으로 이 모형이 무승부를 실제보다 낮게 잡는 문제와 이를 고치려는 Dixon-Coles 보정의 개념을 다룹니다.

미리 밝혀 둡니다. 이 글의 숫자는 모두 설명용 가상 값입니다. 특정 경기의 결과를 맞히려는 글이 아니라, 확률 모형이 어떻게 만들어지는지 이해하기 위한 글입니다.

포아송 분포는 어떤 상황을 설명하는가

포아송 분포는 "정해진 시간 안에 드물게, 서로 독립적으로 일어나는 사건이 몇 번 일어나는가"를 설명하는 확률 분포입니다. 하루에 콜센터로 걸려 오는 전화 수, 한 시간 동안 교차로를 지나는 사고 차량 수 같은 예가 교과서에 자주 나옵니다.

축구 골도 이 조건과 꽤 닮았습니다.

  • 정해진 시간: 경기는 90분(추가 시간 포함)으로 길이가 거의 같습니다.
  • 드문 사건: 슈팅은 많아도 골은 한 경기에 보통 두세 개 정도입니다.
  • 대체로 독립적: 한 골이 들어갔다고 다음 골이 반드시 빨리 나오거나 늦게 나오지는 않는다고 근사할 수 있습니다.

이 세 가지가 대략 성립하면, 평균값 하나만으로 0골, 1골, 2골이 나올 확률을 모두 계산할 수 있습니다. 1982년 통계학자 마이클 마허(Michael Maher)가 두 팀의 득점을 각각 독립적인 포아송 분포로 놓는 모형을 제안한 이후, 이 방식은 축구 통계 입문의 기본 틀이 되었습니다.

공식 읽는 법: P(k) = λ^k · e^-λ / k!

공식은 짧지만 기호가 낯설 수 있으니 하나씩 풀어 보겠습니다.

기호뜻축구에서의 의미
λ (람다)평균 발생 횟수그 경기에서 기대되는 득점
k실제 발생 횟수실제로 넣은 골 수 (0, 1, 2, …)
e자연상수 약 2.71828계산에 쓰는 상수
k!k 팩토리얼1×2×…×k, 단 0! = 1

예를 들어 λ = 1.5인 팀이 정확히 2골을 넣을 확률은 다음과 같습니다.

  • 1.5² = 2.25
  • e^-1.5 ≈ 0.2231
  • 2! = 2
  • P(2) = 2.25 × 0.2231 ÷ 2 ≈ 0.2510 → 약 25.1%

같은 방식으로 0골은 e^-1.5 ≈ 0.2231(약 22.3%), 1골은 1.5 × 0.2231 ≈ 0.3347(약 33.5%)입니다. 평균이 1.5골인 팀도 다섯 경기 중 한 경기 이상은 무득점일 수 있다는 뜻입니다.

가상의 두 팀으로 골 수별 확률 계산하기

이제 가상의 경기를 하나 설정합니다. 홈팀 A의 기대 득점은 λ = 1.5, 원정팀 B의 기대 득점은 λ = 1.1이라고 가정합니다. 실제 분석에서는 리그 평균, 팀의 공격력·수비력, 홈 이점 등을 조합해 이 값을 추정하지만, 여기서는 계산 과정에 집중하기 위해 값을 정해 두고 시작합니다.

골 수 kA팀 (λ=1.5)B팀 (λ=1.1)
022.31%33.29%
133.47%36.62%
225.10%20.14%
312.55%7.38%
44.71%2.03%
5골 이상1.86%0.54%

B팀의 1골 확률을 검산해 보겠습니다. e^-1.1 ≈ 0.3329이고, 1.1 × 0.3329 ≈ 0.3662이므로 36.62%입니다. 각 열을 모두 더하면 100%가 되는지도 확인해 두면 계산 실수를 잡을 수 있습니다.

두 팀 확률을 곱해 스코어표로 펼치기

두 팀 득점이 서로 독립이라고 가정하면, 특정 스코어의 확률은 두 확률을 곱하면 됩니다. 예를 들어 1-1은 A팀 1골(33.47%) × B팀 1골(36.62%) ≈ 12.26%입니다.

이렇게 0~3골 범위를 모두 곱하면 아래 표가 나옵니다. 행은 A팀 골, 열은 B팀 골입니다.

A \ B0123
07.43%8.17%4.49%1.65%
111.14%12.26%6.74%2.47%
28.36%9.19%5.06%1.85%
34.18%4.60%2.53%0.93%

이 표를 대각선 기준으로 나누면 경기 결과 확률이 됩니다. 0~10골까지 모든 칸을 더해 계산한 값은 다음과 같습니다.

  • A팀 승 (대각선 아래): 약 46.4%
  • 무승부 (대각선): 약 25.8%
  • B팀 승 (대각선 위): 약 27.8%

총 득점도 바로 구할 수 있습니다. 독립적인 포아송 변수 두 개의 합은 다시 포아송 분포를 따르므로, 총 득점의 평균은 1.5 + 1.1 = 2.6입니다. 총 득점이 2골 이하일 확률은 P(0) + P(1) + P(2) ≈ 7.43% + 19.31% + 25.10% ≈ 51.8%입니다.

이렇게 얻은 확률을 배당과 비교하는 방법은 기대값 기초 글에서, 여러 경기를 묶을 때 확률이 어떻게 줄어드는지는 조합 확률 계산 글에서 다룹니다. 다만 모형이 내놓은 확률은 어디까지나 가정 위에 세운 추정치라는 점을 잊지 않아야 합니다.

포아송 모형의 한계: 무승부를 낮게 잡는다

포아송 모형은 단순하고 설명력도 좋지만, 실제 데이터와 비교하면 꾸준히 어긋나는 부분이 있습니다.

  1. 저득점 무승부 과소추정: 여러 연구에서 0-0과 1-1이 독립 포아송 모형의 예측보다 자주 나온다는 점이 지적되었습니다. 두 팀이 서로 상대 전술에 반응하기 때문에 득점이 완전히 독립이 아니라는 해석이 많습니다.
  2. 경기 중 상황 변화: 앞서는 팀은 수비적으로, 뒤지는 팀은 공격적으로 바뀝니다. 득점 확률이 90분 내내 일정하다는 가정과 맞지 않습니다.
  3. λ 추정 오차: 모형의 정확도는 결국 평균 득점 추정에 달려 있습니다. 시즌 초반처럼 표본이 적으면 λ 자체가 크게 흔들립니다.
  4. 퇴장·부상 같은 사건: 경기 전 정보만으로 만든 λ는 경기 중 큰 변수를 반영하지 못합니다.

특히 1번은 확률표 해석에 직접 영향을 줍니다. 위 예시에서 무승부 25.8%는 실제보다 낮게 계산되었을 가능성이 있다는 뜻입니다.

Dixon-Coles 보정의 개념

1997년 마크 딕슨(Mark Dixon)과 스튜어트 콜스(Stuart Coles)는 이 문제를 줄이기 위해 저득점 네 칸(0-0, 1-0, 0-1, 1-1)에만 보정 계수 τ(타우)를 곱하는 방법을 제안했습니다. 보정의 세기는 ρ(로)라는 값 하나로 조절합니다. ρ가 음수이면 0-0과 1-1은 늘고, 1-0과 0-1은 줄어듭니다.

스코어보정 계수 τρ = -0.1일 때보정 전 → 보정 후
0-01 − λA·λB·ρ1.1657.43% → 8.65%
0-11 + λA·ρ0.858.17% → 6.94%
1-01 + λB·ρ0.8911.14% → 9.92%
1-11 − ρ1.1012.26% → 13.48%

ρ = -0.1은 설명을 위해 고른 값이며, 실제로는 과거 경기 데이터로 추정합니다. 이 보정은 네 칸 안에서 확률을 옮길 뿐이라 전체 합은 그대로 100%입니다. 표에서 0-0과 1-1이 늘어난 양(합계 약 2.4%p)은 0-1과 1-0이 줄어든 양(합계 약 2.4%p)과 같습니다. 그 결과 무승부 확률은 약 25.8%에서 약 28.2%로 올라갑니다.

딕슨과 콜스는 같은 논문에서 최근 경기에 더 큰 가중치를 주는 아이디어도 함께 제시했습니다. 팀 전력은 시즌 중에도 바뀌기 때문입니다. 팀 전력을 하나의 점수로 갱신하는 다른 접근은 Elo 레이팅 설명에서 볼 수 있습니다.

직접 해 볼 때의 체크리스트

공개된 경기 기록(예: football-data.co.uk의 과거 결과 파일)으로 연습해 보려면 다음 순서를 권합니다.

  • 리그 전체의 홈·원정 평균 득점을 먼저 구한다
  • 팀별 공격력(득점 ÷ 리그 평균)과 수비력(실점 ÷ 리그 평균)을 계산한다
  • 두 값을 곱해 경기별 λ를 만든다
  • 0~10골 확률을 계산하고 합이 100%에 가까운지 확인한다
  • 스코어표를 만들고 승·무·패 합계를 검산한다
  • 과거 시즌 결과와 비교해 무승부가 얼마나 어긋나는지 본다

숫자만 보지 말고 부상·일정 같은 맥락도 함께 점검해야 합니다. 그 부분은 축구 경기 분석 체크리스트에 정리되어 있습니다.

자주 묻는 질문

포아송 모형으로 경기 결과를 맞힐 수 있나요?

아닙니다. 모형은 "이 조건이면 이 정도 확률"이라는 추정을 줄 뿐입니다. 46% 확률의 결과는 절반 넘게 일어나지 않습니다. 또 발매되는 상품의 환급률은 100%보다 낮기 때문에, 모형을 쓰더라도 장기적으로 구매자가 손해를 보는 구조는 바뀌지 않습니다.

평균 득점 λ는 시즌 전체 평균을 그대로 쓰면 되나요?

연습용으로는 괜찮지만 정밀하지는 않습니다. 홈과 원정을 나누고, 상대 수비력을 반영하고, 최근 경기에 가중치를 주는 식으로 다듬는 것이 일반적입니다. 표본이 적은 시즌 초반에는 전 시즌 값을 일부 섞기도 합니다.

다른 종목에도 포아송 분포를 쓸 수 있나요?

득점이 드물고 비교적 독립적인 아이스하키 같은 종목에는 비슷한 방식이 쓰입니다. 반면 농구처럼 득점이 매우 잦거나, 야구처럼 이닝 구조가 뚜렷한 종목은 다른 분포나 시뮬레이션이 더 잘 맞는 경우가 많습니다.

#포아송분포#축구통계#스코어확률#데이터분석
투데이토토 편집팀 — 공개된 규칙·공식 안내·경기 기록을 바탕으로 글을 쓰고, 틀린 내용은 확인 즉시 고칩니다. 작성 원칙 · 오류 제보