-
-
확률의 춤 - 일상을 뒤바꾸는 수학의 마법
김상현 지음 / 루미너리북스 / 2025년 9월
평점 :
잘 알고 있는 내용부터 새롭게 접하는 내용까지 수학적 확률 이론과 활용에 대한 많은 이야기들이 들어 있는 책이다. 우선 현대 확률론과 통계학의 기초가 되는 발견인 베르누이 확률에 대해 설명한다. 각 시행은 독립적이며, 각 시행에서 성공 확률은 일정하고, 결과는 성공 또는 실패 두 가지 뿐이라면 시행 횟수가 무한대로 갈 때 성공 비율이 이론적 확률에 수렴한다는 것을 수학적으로 증명했다면서 말이다. 19세기 말 프랑스의 수학자 앙리 푸앵카레는 동전 던지기를 통해 우연성의 본질에 대해 탐구했는데, 동전의 초기 조건(던지는 힘, 각도, 높이 등)이 미세하게 변할 때 최종 결과에 결정적인 영향을 미친다는 것을 발견했다고 한다. 이런 연구는 현대의 카오스 이론으로 발전했다면서 말이다. 한편 카지노에서 플레이어가 베팅한 금액 중에서 카지노가 장기적으로 가져가는 비율을 카지노 쪽에 조금 유리하게 설정한다면서, 크랩스 게임을 예로 들고 있다. 이 게임은 플레이어가 이길 확률이 49.3%, 질 확률은 50.7%인데, 겨우 1.4% 차이에 불과하지만 이 차이가 카지노의 수익을 보장해준다고 말한다. 단기적으로는 플레이어가 크게 이기거나 질 수 있지만 게임을 계속할수록 결과는 평균에 가까워진다면서, 수많은 고객들이 장시간 게임을 하면 카지노는 반드시 수익을 내게 된다고 말한다. 또한 미래에는 순열과 조합의 개념이 더욱 중요해질 것이라 단언한다. 인공지능이 발전하면서 기계가 인간처럼 창의적으로 사고하려면 기존 정보들의 새로운 조합을 찾아내는 능력이 필요하고, 로봇 공학에서 다관절 로봇의 움직임을 계획할 때도 각 관절의 가능한 모든 조합을 고려해야 한다면서 말이다. 유전자 편집 기술이 발전함에 따라 DNA 서열의 가능한 모든 조합을 분석하고 최적의 결과를 예측하는데도 이러한 수학적 도구가 필수적이라고 언급한다.
우리가 접하는 로또 복권의 경우 기댓값은 각 등수의 당첨 확률을 해당 등수의 상금으로 곱한 뒤 각 등수 별 기댓값의 합으로 나타낼 수 있는데, 만일 1등 당첨금이 평균 20억원이라 가정하고 모든 등수의 기댓값을 합하면 약 510원 정도 밖에 되지 않는다고 말한다. 또한 현대의 날씨 예보에서는 새로운 정보가 주어졌을 때 기존의 확률을 어떻게 갱신해야 하는지 알려주는 수학적 원리인 베이즈 정리의 핵심 개념이 중요하게 활용되고 있다고 말한다. 즉, 과거의 기상 데이터와 현재의 관측 결과를 바탕으로 미래의 날씨 확률을 계산하는데, 내일의 최고 기온을 예측할 때 과거의 데이터를 바탕으로 내일의 최고 기온에 대한 사전 확률을 설정하고, 오늘의 기온, 습도, 풍향 등의 관측 결과를 새로운 정보로 활용하여 최고 기온의 확률 분포를 갱신한다고 언급한다. 물론 현대 기상학에서는 단일 예측 모델에만 의존하지 않고 여러 모델의 결과를 종합하는 앙상블 예보 방식을 많이 사용하는데, 각기 다른 초기 조건이나 물리적 가정을 적용한 여러 예보 모델을 동시에 실행하고, 그 결과들을 통계적으로 분석하여 최종 예보를 만든다면서 말이다. 특히 인공지능과 머신러닝 기술을 활용하여 기존의 수치 예보 모델을 보완하고 있는데, 전통적인 수치 예보 모델이 대기의 물리 법칙을 수학적으로 모델링하는 방식이라면 인공지능 모델은 과거의 기상 데이터에서 패턴을 학습하는 방식이라고 언급한다. 한편 20세기 초반 영국의 통계학자이자 생물학자인 로널드 피셔는 유전학과 통계학을 결합하여 현대 집단 유전학의 기초를 마련했는데, 그는 멘델의 유전 법칙을 대규모 개체군에 적용하여 통계적으로 분석하는 방법을 개발했다고 한다. 자연선택이 유전자 빈도에 미치는 영향을 수학적으로 모델링했고, 이를 통해 진화 과정을 정량적으로 예측할 수 있는 방법을 제시했다면서 말이다.
예를 들어, 특정 유전자가 생존에 유리할 때 그 유전자의 빈도가 세대를 거치면서 어떻게 증가하는지를 수학적으로 계산할 수 있다면서, 다른 측면에서 보자면 각 유전자 변이의 효과는 작지만 이들을 모두 종합하면 개인의 질병 위험을 상당히 정확하게 예측할 수 있다고 말한다. 유전자 편집의 경우에도 그 성공률은 편집하려는 유전자의 위치와 방법에 따라 10%에서 90%까지 크게 달라지는데, 임상에서는 이런 확률 정보가 핵심적이라 덧붙인다. 또한 보험 산업의 확률 활용 사례를 언급하면서, 만일 30세 남성이 1억원의 20년 정기보험에 가입한다면 보험회사가 지급해야 할 보험금의 기댓값은 각 연도별 사망확률과 1억원을 곱해서 모두 더한 값이라 말한다. 이 기댓값에 보험회사의 운영비용과 적정 이윤을 더해서 보험료가 결정된다면서 말이다. 현재는 더욱 정교한 확률 모델들이 개발되고 있는데, 너무 정교한 위험 평가는 보험의 기본 취지인 위험의 분산을 해칠 수 있다고 말한다. 이를테면 유전자 검사를 통해 특정 질병에 걸릴 확률이 높은 사람들에게 높은 보험료를 책정하거나 아예 보험 가입을 거부한다면 그들은 보험의 혜택을 받지 못하게 된다면서, 이는 보험의 사회적 기능을 약화시킬 수 있다고 언급한다. 한편 주식의 미래 가격은 현재 가격에서 무작위로 변할 수 있다는 점도 언급하고 있다. 수많은 투자자들의 매수와 매도 주문이 마치 브라운 운동에서 묘사하는 물 분자의 충돌처럼 주가에 영향을 미친다면서, 개별 거래는 작은 영향을 미치지만, 수만 건의 거래가 모여서 주가의 전체적인 움직임을 만들어낸다는 점을 강조한다. 또한 마코위츠는 현대 포트폴리오 이론으로 분산투자를 제시하고 있는데, 각 주식의 기대 수익률, 리스크의 측정치인 표준편차, 그리고 주식들 간의 상관관계를 계산하여 서로 다른 주식들을 적절히 조합하면 전체적인 리스크를 줄이면서도 좋은 수익률을 얻을 수 있다고 말한다.
미국의 경제학자인 케네스 애로우가 제시한 불가능성 정리도 소개하고 있는데, 세 명 이상의 후보자가 있을 때 모든 유권자의 선호를 공정하게 반영하는 완벽한 투표 시스템은 존재할 수 없다는 것을 수학적으로 증명했다고 말한다. 공정한 투표 시스템이 만족해야 할 조건으로 네 가지가 있는데, 첫째, 유권자의 선호가 바뀌면 결과도 바뀌어야 한다는 것이고, 둘째는 만약 모든 유권자가 A를 B보다 선호한다면 투표 결과도 A가 B보다 우선해야 한다는 것이며, 셋째는 A와 B 사이의 상대적 순위는 제3의 후보 C와 무관해야 한다는 것이고, 넷째는 어떤 한 사람의 의견이 결과를 좌우해서는 안 된다는 것이라 말한다. 이 네 가지 조건을 모두 만족하는 투표 시스템은 존재할 수 없다는 것을 증명했다는 말이다. 또한 확률에 기반한 판단이 개인의 인권을 침해하거나 편견을 강화할 수 있다는 우려도 언급하고 있다. 예를 들어, 특정 지역이나 인구 집단에 대한 통계적 데이터가 편향되어 있다면, 이를 바탕으로 한 베이즈 방식의 추론은 불공정한 결과를 낳을 수 있다면서 말이다. 한편 양자 암호학에 대해 언급하면서 가장 잘 알려진 것이 양자키 분배 방식이라 말한다. 누군가가 양자 상태를 측정하는 순간 그 상태가 변해 버리기 때문에 도청자가 정보를 가로채려고 하면 양자 상태가 변화하여 도청 시도를 즉시 알아챌 수 있다면서 말이다. 또한 우리 뇌의 기본 단위인 뉴런은 전기 신호를 통해 정보를 전달하고 있는데, 뉴런이 신호를 보낼지 말지는 확률적으로 결정된다고 말한다. 뉴런 내부의 전기적 신호가 특정 수준을 넘어서야 다음 뉴런으로 신호가 전달되지만, 이 특정 수준은 고정되어 있지 않다면서, 뉴런의 상태, 주변 환경, 심지어 시간에 따라서도 변화한다고 언급한다. 이어서 각 사건의 확률이 이전 사건에서 도달한 상태에만 의존하는 일련의 가능한 사건들을 설명하는 마르코프 체인에 대해 소개한다.
문장을 생성할 때 각 단어의 선택이 직전 단어에만 의존한다고 가정하면, 마르코프 체인을 이용해 그럴듯한 문장을 만들어낼 수 있다고 말한다. 한국어는 어근에 다양한 어미가 붙어서 의미가 결정되는데다가 이전 음절이 다음 음절의 가능성을 크게 제약하기 때문에, 한국어 처리에서 마르코프 체인이 특히 유용하다고 언급한다. 한편 베이지만 신경망은 의료 진단, 자율주행 차량 등 높은 신뢰성이 요구되는 분야에서 특히 유용하다고 말한다. 예를 들어, 자율주행 차량이 도로 위의 물체를 식별할 때 단순히 저것은 사람이라고 판단하는 것보다 저것은 80% 확률로 사람이며, 이 판단에 대한 확신은 95%라고 판단하는 것이 더 안전한 의사결정을 가능하게 한다고 말한다. 신뢰도가 낮을 때는 운전자에게 제어권을 넘기거나 더 보수적인 운전을 하도록 설계하면 된다면서 말이다. 또한 암호화 알고리즘으로 많이 사용되는 RSA의 안전성은 큰 소수를 무작위로 선택하는 능력에 크게 의존하는데, 여기에도 확률론적 약점이 있다고 말한다. 소수는 숫자가 커질수록 점점 드물어지는데, RSA 키를 만들 때 컴퓨터는 특정 범위에서 소수를 찾기 위해 여러 번 시도해야 한다고 말한다. 똑똑한 공격자라면 이 정도 크기의 소수를 찾으려면 대략 이 정도 시도가 필요하다고 추측할 수 있고, 많은 사람들이 비슷한 방법으로 소수를 생성한다면 우연히 같은 소수를 선택할 가능성도 있다고 언급한다. 만약 두 사람이 같은 소수를 사용한다면 그들의 RSA 키는 서로 연관성이 생기게 되어 보안에 취약해질 수 있다면서 말이다. 한편 시계열 분석 방법의 대표격이며 과거의 관측 값과 오차를 이용해 미래의 값을 예측하는 모델인 ARIMA 모델에 대해 설명하고 있다.
ARIMA 모델의 각 구성 요소를 살펴보면 AR 부분은 현재 값이 과거 값들의 선형 조합으로 표현될 수 있다는 가정에 기반을 두고 있고, MA 부분은 현재 값이 과거의 예측 오차들의 선형 조합으로 표현될 수 있다는 가정에 기반을 두고 있다고 말한다. 즉, 예측 실수에서 배운다는 개념이란 말이다. I 부분은 비정상 시계열을 정상 시계열로 변환하기 위한 차분 과정인데, 추세를 제거한다는 개념이라 언급한다. 그 밖에도 이 책에서는 최신 확률 이론들을 소개해주고 있는데, 대표적인 것이 랜덤 그래프 이론이다. 노드들이 무작위로 연결되는 네트워크 모델에 대한 연구를 소개하고 있는데, 연결 확률이 특정 값을 넘어서면 네트워크에서 거대한 연결 성분이 갑자기 나타난다는 점을 언급하고 있다. 또한 연결선 개수의 분포가 멱법칙을 따르는, 즉 대부분의 노드는 적은 연결을 갖고 극소수의 노드가 거대한 연결을 가진 일종의 허브 형태를 띠는 네트워크를 척도 없는 네트워크라고 하는데, 이런 종류의 네트워크는 무작위 공격에 대해서는 매우 강한 회복력을 보이지만, 중요한 노드들을 겨냥한 표적 공격에는 취약하다고 말한다. 마지막으로 확률 분포를 기하학적 관점에서 바라볼 수 있는 정보 기하학에 대해 소개해주고 있는데, 확률 분포는 단순한 숫자들의 나열이 아니라 정보를 담고 있는 하나의 구조체라고 말한다. 예를 들어, 동일한 평균을 가진 두 개의 정규 분포라도 분산이 다르면 완전히 다른 특성들을 보인다면서, 이런 차이점들을 기하학적 공간에서 점과 점 사이의 거리나 곡률로 표현할 수 있다면 복잡한 확률적 현상들을 직관적으로 이해할 수 있다고 언급하고 있다.