[호평동 바꿈영수학원] 버스 도착 시간 예측에 숨은 평균의 수학
핵심 개념
호평동에서 버스를 기다려 본 사람이라면 누구나 비슷한 경험이 있을 것입니다. 버스 앱에는 분명 7분 뒤 도착이라고 떴는데, 실제로는 3분 만에 오기도 하고 12분을 기다리게 되기도 합니다. 이 차이를 수학으로 들여다보면 평균과 편차라는 개념이 자연스럽게 등장합니다.
버스 도착 예측 시간이라는 것은 사실 과거에 그 버스가 그 구간을 지나온 기록을 바탕으로 계산한 값입니다. 예를 들어 어떤 버스가 지난 열흘 동안 정류장에 도착하는 데 걸린 시간이 6분, 8분, 7분, 5분, 9분, 7분, 6분, 10분, 7분, 5분이었다고 해 봅시다.
이 열 개의 숫자를 모두 더하면 70분이 되고, 70을 10으로 나누면 평균은 7분이 됩니다. 앱이 보여주는 7분이라는 예측값은 바로 이렇게 나온 숫자일 가능성이 큽니다.
그런데 평균이 7분이라고 해서 버스가 매번 정확히 7분 뒤에 오는 것은 아닙니다. 실제 기록을 보면 5분 만에 온 날도 있고 10분이 걸린 날도 있습니다. 평균은 전체를 대표하는 값일 뿐, 그 안의 흩어진 정도까지 알려주지는 않습니다. 이 흩어진 정도를 수치로 표현한 것이 편차입니다.
편차는 각 자료값에서 평균을 뺀 값으로, 평균보다 늦게 온 날은 양수, 평균보다 일찍 온 날은 음수가 됩니다. 위의 열흘 기록으로 편차를 구해 보면 순서대로 -1, 1, 0, -2, 2, 0, -1, 3, 0, -2가 나옵니다.
여기서 재미있는 점은 이 편차들을 전부 더하면 항상 0이 된다는 사실입니다. 실제로 더해 보면 -1+1+0-2+2+0-1+3+0-2 = 0이 됩니다. 평균보다 늦은 만큼과 평균보다 빠른 만큼이 정확히 상쇄되기 때문인데, 이는 평균이라는 값 자체가 '자료를 고르게 나누었을 때의 기준점' 역할을 하기 때문입니다. 그래서 편차의 합이 0이라는 성질은 평균이 제대로 계산되었는지 확인하는 방법으로도 쓰입니다.
편차의 합이 항상 0이라면, 흩어진 정도를 비교할 다른 방법이 필요합니다. 이때 쓰는 것이 편차를 제곱해서 더한 뒤 평균을 낸 분산, 그리고 분산에 제곱근을 씌운 표준편차입니다. 위의 편차들을 제곱하면 1, 1, 0, 4, 4, 0, 1, 9, 0, 4가 되고, 이를 모두 더하면 24가 됩니다.
24를 10으로 나누면 분산은 2.4이고, 여기에 제곱근을 씌우면 표준편차는 √2.4로 약 1.5 정도가 됩니다. 이 값이 작을수록 버스가 거의 비슷한 시간에 도착한다는 뜻이고, 값이 클수록 도착 시간이 들쭉날쭉하다는 뜻입니다.
같은 평균 7분이라도 표준편차가 1.5분인 노선과 5분인 노선은 체감이 전혀 다릅니다. 표준편차가 작은 노선은 앱의 예측을 믿고 느긋하게 움직여도 되지만, 표준편차가 큰 노선은 평균만 보고 집을 나섰다가는 낭패를 볼 수 있습니다. 그래서 실제로 버스 도착 정보를 다루는 시스템에서는 평균뿐 아니라 과거 기록의 흩어진 정도까지 함께 반영해서 예측의 신뢰도를 판단하는 경우가 많다고 알려져 있습니다.
중학교 과정에서 배우는 대푯값과 산포도, 그리고 고등학교 과정에서 다루는 분산과 표준편차는 이렇게 아주 가까운 일상 속에서 작동하고 있습니다. 버스를 기다리며 핸드폰 화면의 숫자를 보는 짧은 순간에도, 그 숫자 뒤에는 평균을 구하고 편차를 계산하는 수학이 숨어 있는 셈입니다.
