수학이나 통계를 잘 모르면 모델의 정확도를 높이는 데 중요한 역할을 하는 수치인 하이퍼 파라미터 튜닝의 개념을 이해하지 못한다. 그럼 새로운 데이터를 접했을 때 원하는 정확도를 얻지 못한다. 다른 딥러닝 모델과 결합하여 새로운 모델을 만드는 작업도 할 수 없을 것이다. - P29
AI 빅데이터 분석은 딱 하나의 정형화된 공식이 있는 게 아니다. 데이터의 성격이나 프로젝트 목적에 따라 다양한 형태의 모델을 생성해야 한다. 이때 수학이나 통계학적 지식은 필수다. - P29
컴퓨터를 이용해 알고리즘을 계산하려면 프로그래밍 언어를 이용해 계산에 필요한 원리를 컴퓨터가 알 수 있게 해야 한다. 즉, 인공지능 개발 분야에 맞는 프로그래밍 언어를 찾은 후 해당 언어를 공부해야 한다. AI 빅데이터 분석에 많이 사용되는 프로그래밍 언어는 파이썬 Python, R, 스파크Spark 등이 있다. - P30
티오베TIOBE는 소프트웨어 코드 품질을 관리해주는 업체이다. 꽤 오랫동안 데이터를 수집, 분석했기 때문에 신뢰도가 있는 동향을 파악하는 데 유용한 자료를 제공한다. - P31
AI 빅데이터 전문가는 단순히 수학이나 프로그래밍을 잘하는 데 그치지 않고 전반적인 문제 해결 능력이 있어야 한다. 즉, 어떠한 비즈니스 관점의 문제가 발생했을 때 비기술적인 관점에서 문제의 본질을 파악하고 해당 문제를 해결하는 데 필요한 구체적인 목표를 설정할 수 있어야 한다. - P33
기술적으로 구현한 알고리즘을 통해 어떠한 결과가 나오면 이를 해석해서 비즈니스에 접목할 수 있는 능력도 필요하다. 즉, 단순히 수학적으로 어떤 결과가 나왔다고 끝이 아니라 이를 제대로 해석해서 실제 비즈니스 의사 결정에 어떻게 적용할지도 생각해야 한다. 결과를 타인에게 효과적으로 전달하기 위한 보고서 작성, 의사소통 능력도 필요하다. - P33
산업 분야마다 데이터가 다양할 뿐만 아니라 성격이 다르기 때문에 데이터를 제대로 이해하려면 산업 분야 각각을 대략적으로라도 이해하고 있어야 한다. 실제로 인공지능 개발에 필요한 알고리즘이나 산업 분야의 최신 트렌드는 빠르게 바뀌므로 최신 논문도 항상 읽어봐야 한다. 이를 쫓다 보면 자연스레 영어 독해 능력의 필요성도 느낄 것이다. - P33
여기서 말하는 공부는 꼭 특정 분야의 자료를 읽는 게 아니다. 매일 책, 논문, 신문을 읽고, 여기서 나온 모든 주제가 AI 빅데이터와 어떻게 접목될지 생각해보는 것이다. - P33
AI 빅데이터를 제대로 배우려면 알고리즘에 대한 수학 이론, 데이터 전처리, 직접 프로그래밍하고 이를 직접 변형하는 정도까지 다루어야 한다. - P42
빅데이터란 데이터를 다루는 전통적인 방법이나 도구로 수집, 저장, 분석 등이 어려운 정형 및 비정형 데이터들을 의미한다. 이는 일반적인 컴퓨터에 담을 수 없는 거대한 용량을 의미하기도 하지만 쉽게 처리할 수 없는 다양한 데이터가 동시에 생성되느냐를 의미하는 것이기도 하다. - P52
빅데이터를 설명할 때 가장 많이 언급하는 용어로 3V가 있다. 최근에는 5V로 확장하기도 한다. 3V는 데이터의 양Volume, 데이터 생성 속도velocity, 형태의 다양성variety을 의미한다(O‘Reilly Radar Team, 2012), 이에 덧붙여 정확성veracity과 가치value를 추가로 언급하는 편이다. - P52
이 데이터가 얼마나 신뢰성(trustworthy)이 있는지, 데이터의 품질이 좋은지에 관한 것이 정확성을 따지는 지표가 된다. - P53
데이터 마이닝 기법 : 대규모로 저장된 데이터에서 자동으로 체계적인 통계적 규칙이나 패턴을 분석해 가치 있는 정보를 추출하는 과정을 말한다. - P53
4차 산업혁명에서 언급하는 모든 기술은 데이터 기반으로 이루어진다. 인공지능, 로봇공학, 사물인터넷, 무인 운송, 3차원 인쇄, 나노 기술 모두 빅데이터가 꼭 필요하다. 즉, 빅데이터는 사람에 비유하면 혈관의 피와 같은 존재인 것이다. - P55
AI(Artificial Intelligence)라고 하는 인공지능은 빅데이터가 가장 필요한 분야다. 인공지능의 핵심은 지금까지 사람이 해왔던 의사결정 및 판단을 인공지능 모델로 대체해 더 정확하고 빠르게 자동으로 하는 것이다. 인공지능 모델은 주로 머신러닝과 딥러닝 기술을 활용해서 만들어지는데, 딥러닝의 가장 핵심이 되는 것이 빅데이터다. - P55
머신러닝과 딥러닝은 빅데이터 안의 패턴을 자동으로 인식한 후 새로운 데이터를 대상으로도 정확한 판단을 출력할 수 있도록 하는 기술이다. 따라서 빅데이터 안의 데이터가 다양할수록 훨씬 더 정확한 모델을 갖출 가능성을 지닌다. 데이터가 다양할수록 그 안에 세상의 패턴 또는 정보가 많이 담기기 때문이다. - P55
한 분야의 전문가가 되려면 많은 공부를 해야 하며, 공부량이 늘수록 해당 분야에 대해 박식해진다. 즉, 공부량과 전문성이 어느 정도 비례하기 마련이다. 이 공부량이 인공지능에서는 데이터의 양이라고 말할 수 있다. 데이터를 많이 학습할수록 인공지능 모델이 더 정교해진다. - P55
로봇공학은 언제나 빅데이터를 수집할 좋은 분야이다. 로봇은 감지-계획-행동 세 단계를 반복적으로 실행하는 구조체다. 감지 단계에서는 범위, 위치, 시각, 촉각 센서에서 들어오는 빅데이터를 수집하고 계획 단계에서는 수집된 빅데이터를 활용하여 원하는 목적과 책임을 정한다. 이때 머신러닝이나 딥러닝 같은 빅데이터 분석 방법론이 주로 사용되고 있다. 최근에는 로봇의 시각 센서에 들어오는 빅데이터를 활용해 이미지를 분석하는 딥러닝 기술이 발달하면서 로봇의 의사결정 기능이 더욱 정확해지고 있다. - P56
사물인터넷은 사물 사이의 센싱, 네트워킹, 정보처리 등을 사람의 개입 없이 상호 협력하여 지능적인 서비스를 제공해주는 연결망이다. 우선 센서를 통해 온도, 습도, 조도, 열, 연기, 풍량, 풍향, 초음파, GPS, 영상 등을 수집하여 주변 환경의 물리적인 정보를 수집한다. 최근에 나오는 지능형 센서들은 단순히 원시 데이터raw data를 추출하는 센서의 역할을 벗어나 원시 데이터를 가공한 고차원적인 정보까지 수집한다. 그 후 와이파이Wi-Fi, 블루투스Bluetooth, LTE 등과 같은 네트워크 기술을 통해 사물 사이에서 데이터를 송수신한다. - P57
사물인터넷은 단순히 많은 사물과 기기로 네트워크를 통해 데이터를 송수신하는 것만으로 가치를 만들어내는 것이 아니다. 사물들에게 얻은 데이터들을 분석하고, 분석한 정보를 통해 사용자에게 가치를 주어야 한다. 이 과정에서 당연히 빅데이터 분석과 인공지능 기술이 필요하다. - P57
라이다 : 레이저 광선을 발사하고 그 반사와 흡수를 이용하여 대기 중의 온도, 습도, 시정(視程) 따위를 측정하는 다목적 대기 현상 관측 장치를 말한다 - P58
빅데이터 분석 역시 다양한 데이터 속 패턴을 찾아 고객 맞춤형 서비스를 제공하기 위한 방편으로 활용하는 것 - P58
나노 기술은 나노미터(10억분의 1미터)에 근접한 원자 정도 단위에서 물질을 합성, 조립, 제어하는 기술을 말한다. 나노 기술의 발달로 초미세 단위 물질에 대한 접근이 가능해졌고, 여기서 파생되는 데이터도 수집할 수 있게 되었다. 이러한 데이터는 기존에 얻지 못했던 데이터이기 때문에 빅데이터 분석 및 인공지능 모델에 사용되면 그전에 보지 못했던 새로운 물질에 대한 인사이트를 얻는 데 효과적이다. - P59
빅데이터 분석을 통해서 전체적인 윤곽을 본 후 사람의 판단과 이론을 접목해서 향상된 알고리즘을 만들어야 한다 - P60
진정한 빅데이터 분석은 분석가가 끊임없이 사고하고 연구하면서 본인 혹은 다른 연구자가 세운 이런저런 이론에 대한 가설을 실험해 보아야 하는 것이다. 이 과정에서 과거에 보지 못했던 새로운 인사이트를 도출해내고 이를 미래에 활용할 수 있는 방향을 찾게 되는 것이다. - P61
데이터 3법의 핵심은 개인 정보의 일부를 삭제하는 방법으로 특정 개인을 알아볼 수 없도록 처리한 가명 정보를 동의 없이 금융, 연구 목적 등에 사용할 수 있다는 점이다. - P61
초개인적 : 개인의 의식 상태를 초월하여 집단적 무의식의 상태를 지니는 것 - P61
개인 수준에서는 회사에 개인 정보가 수집되는 과정, 개인 정보가 활용되는 목적, 개인 정보가 공유되는 대상을 요구해 면밀히 살펴야 한다. 기업에서 보유하는 개인 정보 열람은 ‘개인정보보호법 제35조‘에 따라 요구할 수 있는 당연한 권리이기도 하다. - P62
인공지능이 가장 최상위 개념이고 그다음에 머신러닝, 그다음에 딥러닝이 포함되는 개념이다. - P63
인공지능은 시스템으로 만든 지능을 갖는 컴퓨터 시스템 모두를 총칭하는 개념이다. 즉, 요즘에 주목받는 딥러닝, 머신러닝, 빅데이터가 꼭 들어 가야 하는 게 아니다. - P64
80년대 유행했던 전문가 시스템 Expert System은 인공지능의 응용분야에 해당한다. 전문가 시스템은 해당 도메인의 전문가 집단이 설정한 논리적인 조건들을 모두 컴퓨터에 구현한 것이다. 즉 수많은 if-then-else 조건문으로서 세상의 법칙을 설명하려 한 것이다. - P64
if-then-else 조건문 : ‘만약-그래서-아니면‘이라는 조건에 따라 논리를 설계하는 프로그래밍 언어의 개념 - P64
기존의 전문가 시스템이 전문가가 도출한 수많은 규칙에 의해서 동작했다면 머신러닝과 딥러닝은 데이터 기반 학습으로 규칙과 정답을 추론한다. 즉, 전문가 집단의 지식이 거의 또는 아예 필요 없게 되었다. - P66
이제는 사람의 지식보다는 얼마나 많은 양질의 데이터셋을 갖느냐가 경쟁력이 되었다. 데이터는 4차 산업혁명 시대의 원유인 것이다. 이에 따라 데이터의 부익부빈익빈 현상이 가속화되고 있다. - P67
머신러닝은 머신이 스스로 학습해 어떤 일을 처리하는 알고리즘 모델을 만드는 것이다. 사람이 지식을 습득하면 인지, 판단, 유추와 같은 사고를 할 수 있는 것처럼, 머신에게 데이터를 학습시켜 사람처럼 판단을 할 수 있는 사고 모델을 내놓는 것이다. - P68
딥러닝은 머신러닝의 하나로 스스로 학습해 알고리즘 모델을 만드는 네트워크가 깊은 계층으로 이루어겼다는 차별점이 있다. - P68
머신러닝은 크게 지도 학습 supervised Learning과 비지도 학습Unsupervised Learning으로 나뉜다. 더 자세히 살펴보면 준지도 학습Semi-Supervised Learning, 강화 학습 Reinforcement Learning, 원샷 학습 One-shot Learning 등으로 나눌 수 있지만 - P69
지도 학습이란 정답을 이용하여 알고리즘을 학습하는 방법이다. 머신러닝의 지도 학습은 학습에 필요한 데이터를 수집할 때 정답(정답을 레이블 label 혹은 타깃 target이라고 함)을 두고 학습하는 방법이다. 물체 이미지 분류 알고리즘을 학습하기 위해서는 어떤 물체를 무엇으로 분류할지에 대한 정답이 꼭 있어야 하는 것과 같다. - P69
MNIST, CIFAR-10, IMDB review, Reuters newswire와 같이 연구 목적으로 공개된 데이터들 - P70
지도학습의 과정을 간단히 살펴보면 데이터를 알고리즘에 입력하고 나온 출력값을 정답 데이터와 비교해서 오차를 확인한 후 이를 줄여나가는 방식이다. - P70
빅데이터를 이용해 학습하면 머신러닝 알고리즘의 가중치가 가장 최적화되며, 학습 데이터 이외의 새로운 데이터를 사용해도 실제 정답과 비슷한 출력 결과를 내놓는 것이다. - P70
학습 과정에서 사용하는 수학적 개념으로는 분류classification 와 회귀Regression가 있다. 분류는 알고리즘이 개, 고양이를 맞추는 것처럼 일정한 유형을 판단하는 개념이다. 회귀는 알고리즘이 가격이나 몸무게를 예측하는 것처럼 최대한 정확한 숫자를 나타내는 개념이다. 따라서 분류냐 회귀냐에 따라 정확도 측정 방법, 알고리즘 학습에 사용하는 오차 함수나 활성화 함수 등이 다르다. - P71
비지도 학습은 지도 학습과 반대로 데이터를 이용해 학습할 때 정답이 없는 경우다. - P71
비지도 학습은 데이터의 패턴을 알고 싶거나 데이터를 압축, 축소할 때 사용한다. - P71
데이터 패턴을 구하는 가장 대표적인 예는 군집화clustering 다. 군집화는 전체 데이터를 비슷한 패턴을 지닌 몇 개의 그룹으로 나눈다. 각각의 그룹이 정확히 무엇인지는 정답은 없지만 일정 패턴에 따라 나누다 보면 서로 비슷한 데이터가 그룹으로 묶이는 것이다. - P71
데이터를 압축, 축소해주는 비지도 학습 예에는 오토인코더Autoencoder와 주성분 분석 Principal component analysis, PCA(이하 PCA)가 있다. 둘 다 다수의 차원으로 구성된 데이터를 압축, 축소해서 소수의 차원으로 변환한 후 시각화를 통해 데이터의 패턴을 파악하거나 노이즈를 제거하는 것이다. 여기서 말하는 시각화란 예를 들어 10차원의 데이터를 10차원 그대로 나타낼 수 없으므로 사람이 알 수 있는 2차원 또는 3차원으로 변환하여 표현하는 과정을 말한다. - P72
딥러닝이란 2개 이상의 은닉층 Hidden layer으로 이루어진 신경망 Neural network을 이용해 학습하는 머신러닝 알고리즘의 집합이다. - P73
신경망은 생물학의 신경(뉴런)이 네트워크를 이뤄 신체를 제어하는 각종 정보를 교환하는 개념을 컴퓨터 연산에 도입한 것이다. - P73
머신러닝에도 다층 퍼셉트론Multilayer perceptron, MLP이라는 알고리즘이 있다. 이는 데이터의 입력값과 출력층 사이에 은닉층을 두어 학습할 때 필요한 최적의 가중치를 계산한다. 하지만 복잡한 모델을 구성하기 위해서는 은닉층 1개로는 부족하기에 2개 이상의 은닉층으로 구성한 모델들이 생겨났고 이를 딥러닝이라고 부르기 시작한 것이다. - P74
딥러닝은 신경망을 어떻게 구성하냐에 따라서 심층 신경망Deep neural network, DNN, 합성곱 신경망Convolution neural network, CNN, 순환 신경망Recurrent neural network, RNN, 장단기 메모리 Long short-term memory, LSTM, 게이트 순환 유닛Gated recurrent unit, GRU, 오토인코더, 어텐션 메커니즘Attention mechanism 등 여러 가지로 나눌 수 있다. 또한 세부 파라미터를 어떻게 설정하느냐에 따라 모델 각각을 다시 여러 가지 방식으로 만들 수 있다. - P75
|