오늘은 데이터베이스의 개념에 대해 간단히 소개하면서 시작한다. 또한 최근 온라인 상의 데이터가 폭발적으로 증가하고 있고 기타 관리상의 이슈들도 있기 때문에 저자는 체계적인 데이터의 관리의 필요성을 거듭해서 강조하고 있다.

데이터베이스는 여러 사람이 데이터를 공유해 사용할 목적으로 통합 관리하는 데이터 저장소라고 할 수 있다. - P129

데이터베이스가 필요한 이유는 단순히 데이터양이 많기 때문만이 아니다(단순히 데이터양이 문제였다면 외장 하드디스크 여러 개를 사서 저장하면 그만이다). 여러 사람이 함께 효율적으로 데이터를 공유해야 하기 때문이다. - P130

대형 웹 사이트를 관리하게 되면 여러 개발자가 서로 협업할 텐데 필요한 데이터를 각자 로컬에 저장하면서 그때그때 주고 받으면 업무 효율이 높아질리가 없다. 보통 서버를 하나 만들어두고 해당 서버에 여러 개발자가 원격으로 접속해서 데이터를 함께 관리한다. 이러한 작업의 핵심이 바로 데이터베이스이기도 한 것이다. - P131

데이터를 통합하고 규칙적으로 관리하기 위해서도 데이터베이스는 중요하다. 데이터는 무조건 많이 쌓는다고 좋은 것이 아니다. 실제로 잘 활용할 수 있도록 체계적으로 정리해두어야 한다. - P131

관계형 데이터베이스 관리 시스템(이하 RDBMS)은 시스템에서 설정한 규칙에 따라 데이터를 저장하며, 규칙에 위반되는 데이터는 저장할 수 없도록 관리한다. 어떤 의미로는 강제로 이쁘게 데이터를 규칙적으로 저장하는 것이다. 그럼 이후에 데이터를 이용하는 사람들이 데이터를 활용할 때 많은 이점을 갖게 된다. - P131

2010년 이후에는 비정형 데이터의 양이 늘면서 기존RDBMS보다는 규칙이 자유로운 NoSQL DBMS(이하 NoSQL) 사용이 늘고 있다. 하지만 전세계 관점에서는 RDBMS를 훨씬 많이 사용한다. 실제로도 데이터베이스를 일률적으로 통합 및 관리하기 위해서는 RDBMS가 더 효율적이다. - P131

DBMS의 종류로는 MySQL, MariaDB, Oracle, SQL Server, PostgreSQL, MongoDB 등이 있다. 무료도 있고, 유료도 있으며 각 DBMS에서 지원하는 SQL structured query language을 익혀야 한다. SQL DBMS를 사용하기 위한 명령들의 모음이라고 생각하면 된다. - P132

DBMS마다 지원하는 SQL의 차이가 있지만 한가지를 제대로 배우면 다른 것은 금방 배울 수 있으니 부담을 느끼지 말기 바란다. - P132

DBMS는 크게 RDBMS와 NoSQL로 나뉘어진다. 전통적으로는 모두 RDBMS였는데 빅데이터의 개념이 등장하면서 RDBMS의 단점이 생겨 NoSQL이 나온 것이다. - P132

‘반드시‘라고 말할 수는 없지만 빅데이터를 관리하는 데는 NoSQL 기반 데이터베이스가 상황에 따라 더 효율적일 수 있다. 이는 각 테이블(표)의 규칙에 맞게 데이터를 나눠 저장하는 특성이 실시간으로 발생하는 빅데이터의 수집에 맞지 않기 때문이다. 또한 구조가 복잡해질수록 쿼리문이 복잡해지고 데이터를 읽어오는 성능이 저하되기 때문이기도 하다. - P133

NoSQL은 RDBMS와 비교했을 때 규칙이 단순한 편이므로 훨씬 더 유연하게 데이터를 저장할 수 있다. 또한 처음부터 데이터를 여러 서버에 분산해 저장할 수 있도록 설계되었다는 점도 빅데이터 저장에 용이하다. - P133

하지만 NoSQL도 단점이 많다. 우선 유연하게 데이터를 저장할 수 있다는 장점이 반대로 단점이 되기도 한다. 데이터가 중복하여 여러 번 들어 갈 수 있고 데이터를 저장하는 개발자마다 형식이 제각각인 상태로 저장할 수도 있다. 또한 데이터를 수정할 때 여러 개의 컬렉션(테이블)에 들어가 있는 중복 데이터를 일일이 다 찾아서 수정해주어야 한다. 즉, 처음 DBMS를 설계하는 사람이 빅데이터의 특성을 고려해 RDBMS와 NOSQL 중 적절한 것을 선택해야 한다. - P133

데이터베이스를 처음 공부해야한다면 막막할 수 있다. 하지만 우리는 AI 빅데이터 전문가에게 필요한 수준만 익히면 된다는 사실을 잊지 말자. 다음 몇 가지만 확실하게 익힌다는 목표로 공부해보자. 첫 번째는 CRUD 관련 쿼리를 이해하는 것이다. CRUD는 생성Create, 읽기 Read, 갱신Update, 삭제Delete를 묶어서 표현하는 용어다. - P136

데이터베이스에 저장된 데이터를 분석하려면 데이터를 넣고 빼고 읽고 삭제하고 갱신하는 등의 쿼리를 자유자재로 구사할 줄 알아야 한다. - P136

먼저 데이터 읽기부터 익히자. 데이터 분석의 시작단계이므로 무엇보다 중요하기 때문이다. select*from <테이블이름>(RDBMS 기준)이라는 형태의 쿼리로 전체 데이터를 불러들인 후 데이터를 분석하는 과정부터 익혀도 괜찮다. 실제로 데이터양이 굉장히 적은 테이블이거나 속도 및 성능에 크게 신경을 안 쓰는 상황이라면 이렇게 해도 문제가 없을 것이다. - P136

하지만 여기에 머물러서는 안 된다. 단순무식하게 select*from <테이블 이름>으로 데이터를 매일 불러오다 보면 큰 낭패를 겪게 될 상황이 분명히 닥칠 것이다. 데이터의 양이 많아지면 모든 데이터를 불러오는 시간도 오래 걸리고 서버에 부하가 생길 수 있다. 특히 딥러닝을 활용한다면 스케줄러를 통해 주기적으로 재학습하는 경우가 많은데 재학습할 때마다 모든 데이터를 불러온다면 필연적으로 문제가 발생할 것이다. 따라서 select문에 각종 조건 쿼리를 덧붙여서 데이터를 효율적으로 읽어 오는 방법 정도는 익혀야 한다. - P137

어떻게 쿼리문을 설정해서 데이터를 불러오느냐에 따라 데이터를 읽어 오는 속도나 데이터의 정렬 상태가 달라지며, 이는 데이터 분석을 쉽게 시작할 수 있을지를 결정한다. - P137

데이터 ‘읽기‘에 익숙해졌다면 다음으로 테이블 ‘생성‘, 데이터 ‘갱신‘과 ‘삭제‘를 익히자 역시 데이터를 넣기 위해 한꺼번에 테이블을 생성하거나, 데이터를 갱신 및 삭제하는 것부터 시작해서, 원하는 데이터 각각을 별도로 관리하는 방법을 차례로 익히면 된다. 데이터 ‘읽기‘에 익숙해졌다면 그때 배웠던 조건문 등을 그대로 활용하는 경우도 있으므로 ‘읽기‘를 익힐 때보다는 별로 어렵지 않다. - P137

《SQL 전문가 가이드》(한국데이터베이스진흥원 지음, 한국데이터산업진흥원)는 Oracle과 SQL Server와 관련한 쿼리를 주로 다룬다. ...(중략)... Oracle, SQL Server, MySQL, PostgreSQL 모두 비슷한 SQL 쿼리를 사용하는데, 그 차이를 확실하게 이해하면서 공부할 때는 Oracle과 SQL Server를 비교하는 것이 좋기 때문이다. 이외에 다른 점은 구글 검색을 함께 활용하면 쉽게 익힐 수 있다. - P138

《몽고디비 인 액션》(카일 뱅커 외 4인 지음. 제이펍)는 시간이 없다면 7장 이후의 쿼리 최적화, 복제, 샤딩, 배포와 관리와 같은 부분은 나중에 읽어도 괜찮다. 데이터베이스 전문가가 아니라면 직접 하게 될 일은 없을 것이다. - P138

데이터베이스를 제대로 알기 위해서는 데이터 표준화, 데이터 모델링, 데이터베이스 설계, 데이터베이스 성능 개선 등을 모두 공부해야 한다. 이를 모두 공부해 업무하는 사람을 흔히 데이터베이스 관리자 Database administrator라고 한다. 데이터베이스 관리자까지 욕심이 난다면 데이터 아키텍처 전문가 같은 국가 공인 자격시험에 응시하는 것도 방법이다. - P138

단, 데이터베이스 관리자는 대기업 규모의 회사에서 데이터베이스를 전문적으로 관리할 필요가 있을 때 채용하는 직군이다. - P138

시간이 허락한다면 데이터베이스 관리자가 공부하는 영역을 상식선에서 한 번 쭉 읽어 보길 권한다. 데이터 관련 글을 읽을 때 종종 관련 용어들이 나올 수 있기 때문이다. - P138

관련 자격 시험을 공부하다 보면 기초 실력을 꽤 단단히 다질 수 있다. - P140

(빅데이터분석기사 필기시험에는) 머신러닝, 딥러닝 대표 알고리즘들의 특징 및 드롭아웃, 규제, K겹 교차검증(K-fold cross-validation)과 같은 모델 성능을 높이기 위한 테크닉에 대해서도 출제되었다. - P141

인공지능, 빅데이터에 대해서 앞으로 이 책에서 제시하는 전반적인 모든 것들을 공부하고 (빅데이터분석기사)시험을 보거나 최소한 ADsP(데이터분석 준전문가), 사회조사분석사 2급 필기 공부 후에 기본 데이터마이닝 서적 1권, 기본 딥러닝 서적 1권 정도는 보고 시험을 보는 것을 추천한다. - P141

빅데이터분석기사 이외에 공부해볼만 한 자격 시험이 꽤 있다. 첫번째로 소개할 것은 데이터분석 준전문가 Advanced Data Analytics Semi-Professional(이하 ADsP)다. 물론 ADsP보다 상위 수준 시험인 데이터분석 전문가 Advanced Data Analytics Professional(이하 ADP)가 있다. 하지만 처음 AI 빅데이터 전문가에 관한 공부를 시작했다면 ADsP에 도전해도 충분하다. - P142

ADsP는 한국데이터산업진흥원에서 시행하는 빅데이터 이론자격 시험이다. 시험의 성격은 빅데이터란 무엇인지 이해하고 빅데이터 분석과 관련한 기본 개념을 묻는 것들이다. 이 책에서 지금까지 소개했던 회귀, 시계열 분석, 주성분 분석, 인공신경망 분석, 군집화, 연관성 분석 등이 포함된다. 대학교에서 인공지능과 관련한 과목에서 배우는 기본적인 내용으로 구성되어 있다. 또한 수학적인 내용은 거의 묻지 않으며 R 프로그래밍 언어와 관련된 코드 몇 가지가 등장하는 정도다. 기본이므로 무조건 알아야 하는 개념들이므로 자격도 취득하고 공부도 하는 일석이조라는 심정으로 차분히 준비하면 될 것이다. - P142

(ADsP)구체적인 시험 과목은 ‘데이터 이해‘, ‘데이터 분석 기획‘, ‘데이터 분석‘ 총 3개로 나누어져 있다. ‘데이터 이해‘와 ‘데이터 분석 기획‘은 빅데이터 분석에 대한 전반적인 개론이므로 통상적인 자격시험을 준비할 때와 비슷한 방법으로 준비하면 된다. 관련 자료에서 소개하는 개론을 소설 읽듯이 한번 쭉 읽고 기출 문제와 예상문제를 풀면서 자주 눈에 익히면 쉽게 풀 수 있을 것이다. 세 번째 ‘데이터 분석‘ 파트는 실무에서 사용되는 AI 빅데이터 기법이므로 집중적으로 공부하길 바란다. 합격 여부가 결정되는 과목이며, 가장 필요한 내용이기도 하다. - P143

시험 문항은 총 50개고 60점 이상의 점수를 받으면 합격할 수 있다. 실기 시험이 없으므로 문과 계열을 전공한 사람도 1~2개월만 열심히 공부하면 충분히 합격할 수 있고, 컴퓨터 공학 관련 전공자라면 3주 정도만 공부해도 충분할 것으로 생각한다. - P143

AI 빅데이터 전문가에 뜻이 있다면 해당 자료(데이터 분석 전문가 가이드, ADsP 데이터 분석 준전문가)에 ‘데이터 시각화‘ 부분을 꼭 읽어보기 바란다. 시각화는 실무에서 보고서 작업시 꼭 필요한 내용으로 AI 빅데이터 전문가가 갖춰야 할 주요 기술 중 하나이기 때문이다. 어떤 시각화 기법들이 있는지 살펴본다는 느낌으로 따로 읽으면 된다. - P144

시각화는 ...(중략)... 데이터를 사람이 이해할 수 있는 방법으로 표현하는 것이다. 보통 막대 그래프, 점 그래프, 파이 차트, 스캐터 플롯, 버블 차트, 히스토그램, 히트맵, 스타차트, 다차원척도법 등의 기법을 사용한다. - P144

시간 시각화 : 막대 그래프, 누적 막대 그래프, 점 그래프

분포 시각화 : 파이 차트, 도넛 차트, 트리맵, 누적 연속 그래프

관계 시각화 : 스캐터플롯, 버블차트, 히스토그램

비교 시각화 : 히트맵, 스타 차트, 평행 좌표계, 다차원 척도법

공간시각화 : 지역 정보와 지도의 매핑 - P144

시간 시각화는 시간의 흐름에 따른 데이터의 트렌드를 볼 때 사용한다. 예를 들어 시간에 따른 인구 변화가 있다. - P144

분포 시각화는 시계열과 비슷하지만 구분 단위가 시간이 아니라 분류, 가짓수라는 점에서 다르다. 예를 들어 정부 예산의 부처별 비율을 분포 시각화로 표현할 수 있다. - P145

관계 시각화는 데이터 사이의 상관관계를 표현한다. - P145

좀 더 복잡한 상관관계라면 x축, y축, 버블 크기, 버블 색깔까지 네 가지 변수 사이의 관계를 한 눈에 파악하는 버블 차트 작성이 있다. - P145

비교 시각화는 비교해야 할 변수가 많을 때 사용한다. 히트맵의 경우 x축은 비교할 변수 목록, y축은 데이터 레코드(특정 데이터를 다루는 단위)로 두고 셀 각각에 색을 입힌다. 이때 셀 각각에 부여된 점수에 따라 색의 진한 정도를 다르게 표현한다. 비교 항목 전체를 한 눈에 볼 수 있어 분류 상태나 예외 범위를 찾기 쉽다. - P145

공간 시각화는 지도 안에 지역 정보를 매핑해 시각화하는 것이다. 예를 들어 대한민국 행정 구역별 인구 현황 버블차트를 지도에 표현하면 행정구역별 위치에 원의 크기로 인구수를 반영할 수 있다. 지도의 직관성을 시각화에 활용하여 읽는 이의 흥미를 유도할 수 있다. - P145

ADP는 ADsP의 상위 수준인 만큼 더 세부적인 내용을 외워야하고 R 프로그래밍과 관련된 실기 시험을 통과해야 한다. 따라서 시험에 대비한 R 프로그래밍 함수를 많이 외워야 한다는 것이 주요 차이점이다. - P146

실무에서 R 프로그래밍 함수는 굳이 하나하나 외울 필요 없이 기억이 나지 않으면 구글 등에 검색해서 활용하는 편이다. 이러한 이유로 ADsP를 통과하고 AI 빅데이터 실무를 경험한 후 ADP 도전해도 늦지 않는다고 생각한다. - P146

ADP는 자격을 취득하는 데 제법 오랜 시간이 걸리는 편이므로 공부하는 도중에 지칠 수도 있다. 그리고 최근 데이터 분석에는 R 대신 파이썬이 더 많이 사용되므로 실기 시험 때문에 R을 자세하게 공부해야 하는 것은 비효율적일 수도 있다. - P146

경영 빅데이터 분석사는 ADsP와 많은 내용이 겹치므로 공부해볼만 하다. ADsP를 공부했다면 2주 정도 경영 관련 내용을 더 공부해 자격 시험에 응시할 수 있을 정도다. 경영 빅데이터 분석사는 1급과 2급으로 나뉘는데 2급을 공부하길 권한다. 1급은 R 프로그래밍과 관련한 실기 시험이 주요 당락을 결정하는데 앞에서 언급한 것처럼 R 프로그래밍을 따로 공부하는 것은 비효율적이기 때문이다. - P146

2급 시험에서 따로 공부할 내용은 ‘경영과 빅데이터 활용‘이다. 마케팅, 생산 운영, 회계/재무/인적 자원, 공공 분야, 제조업 등 산업 부분별 빅데이터가 어떻게 활용될 수 있는지 공부한다. - P147

1장에서 AI 빅데이터 전문가가 된 이후 어떤 산업 분야의 실제 프로젝트에 참여할지 모르기 때문에 평소에 산업 분야별로 빅데이터 분석을 어떻게 활용할 수 있을지 알아야 한다고 했다. 2급 시험의 ‘경영과 빅데이터 활용‘이 산업 분야별 빅데이터를 이해하는 데 도움을 준다. - P147

사회조사분석사는 실기까지는 공부할 필요가 없으므로 2급 필기만 공부하면 된다. 실기시험은 SPSS라는 통계 계산 도구를 사용하는데 이는 파이썬이나 R과 같이 AI 빅데이터 분야와 직접적인 연관은 없기 때문이다. - P148

(사회조사분석사) ‘조사방법론 2‘는 샘플링, 측정, 데이터 속성에 관해서 다루며, 기초적이지만 데이터에 관한 가장 기본적인 내용이기에 빅데이터 공부 입문자들이 살펴보면 좋은 부분이다. 해당 내용은 AI 빅데이터를 분석할 때 데이터 전처리에 적용할 수 있다. - P148

‘사회통계‘는 기초 통계, 확률, 가설에 대해 다룬 후 마지막에는 통계 분석에 대해서 다룬다. 분산분석, 상관분석, 회귀분석 등을 다루는데 데이터 마이닝의 가장 기초적인 부분이라 꼭 알고 넘어가면 좋다. 여기서 다루는 통계 분석 개념은 AI 빅데이터 알고리즘을 모델링할 때는 잘 사용하지 않지만 보고서를 작성해야 하는 프로젝트에서는 꽤 유용하다. - P149

흔히 데이터 분석 보고서를 작성하게 되면 초반에 기초 통계를 기반으로 데이터의 형태와 특성을 알 수 있는 간단한 자료를 준비한다. 이를 통해서 데이터의 성격을 파악한 후 적절한 알고리즘을 적용하여 최종 결과를 도출한다. 이러한 초반의 기초 분석이 앞에서 설명한 탐색적 자료 분석이며, 본격적인 데이터 분석에 앞서 필수 과정이다. - P150

탐색적 자료 분석은 데이터를 분석하기 전에 그래프나 통계적인 방법으로 자료를 직관적으로 바라보는 과정이다. 다양한 각도에서 데이터를 살펴보면서 표현하는 현상을 더 잘 이해하면, 사전에 미처 알지 못했던 다양한 패턴을 발견하거나 데이터에 대한 잠재적인 문제를 발견할 수 있다. 또한 이를 바탕으로 가설을 수정하거나 모델의 방향을 바꿀 수 있다. 참고로 ‘사회통계‘에서 공부하는 내용들은 거의 대부분 탐색적 자료 분석에 적용될 수 있다. 쉽고 간단하지만 중요하고 꼭 필요한 내용이므로 기억하길 바란다. - P150


댓글(0) 먼댓글(0) 좋아요(11)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo
 
 
 
잠
무라카미 하루키 지음, 양윤옥 옮김, 카트 멘쉬크 그림 / 문학사상사 / 2012년 10월
평점 :
장바구니담기


조금 전에 너무 피곤해서 얼마간 낮잠을 자고 일어났는데 불현듯 잠이라는 것이 스스로를 재충전하는 것이 아닐까하는 생각이 들었다. 내가 깨어있는 동안 정상적인 컨디션으로 활동하도록 하기 위해 반드시 필요하기 때문이다. 이것은 마치 우리와 한 몸처럼 된 스마트폰을 수시로 충전하는 것과도 비슷한 원리다. 물론 소설속의 화자는 몇 일간 잠을 거의 안자고도 정신이 맑은 다소 비정상적인 상태를 보여주기도 하지만, 이는 우리가 잘 알지 못하는 정신적인 것과 관련된 제3의 다른 요인들(?)로 인해 각성상태가 유지되었던 것일 뿐이다. 궁극적으로 재충전이라는 잠의 근본적인 역할은 부정할 수 없을 듯하다.

댓글(0) 먼댓글(0) 좋아요(22)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo
 
 
 

따로 특별한 이유가 있는 건 아니지만 개인적으로 요 근래에 무라카미 하루키 작가의 작품들에 관심이 생겨서 실제로 얇은 책 2권 정도를 읽었다. 그리고 오늘 시작하는 이 책도 검색하다가 우연히 알게 되었다. 역시나 이 책도 얇은 책인데, 간편하게 읽을 수 있게 소제목 하나당 3페이지 내외로 구성되어 있다. 부담없이 가볍게 하나하나 읽어보면서 작가의 감성을 느껴보는 시간이 되길 바래본다.

처음 밑줄친 문장은 저자가 로마에 거주하던 시절에 직접 경험했던 이탈리아의 문화(?) 같은 것처럼 보인다. 물론 ‘로마에 가면 로마의 법을 따르라‘는 말처럼 그 나라의 문화를 있는 그대로 존중하는 것도 필요하겠으나, 한편으로는 겉으로 드러나는 모습만 가지고 사람을 판단하는 것이 정녕 옳은 것인지는 개인적으로 살짝 의문이긴 하다. 외모나 외관이 좋은 것이 상대방에게 더 나은 대접이나 대우를 받을 가능성을 높이는 한 가지 요소임을 부정할 생각은 없지만 그것이 전부라고 하기에는 좀 조심스럽다는 말이다. (물론 요즘 시대가 보여지는 것의 비중이 워낙에 높은지라 이런 내 생각이 누군가에겐 고리타분하고 구시대적인 발상이라고 여겨질지도 모르겠다.)

이탈리아에서는 괜찮은 옷을 입지 않으면, 레스토랑에 가도 좋지 않은 자리로 안내한다. 이탈리아는 무조건 옷차림으로 사람을 판단하는 나라로 인격이니 능력이니 하는 일상 생활의 레벨은 전혀 관계가 없다. 무엇이 어찌 되었건, 우선은 외양이다. 그래서 모두 말쑥하게 차려입고 있다. 뭐, 그건 그것대로 깔끔해서 좋지 않느냐고 할 수 있겠지만...... - P8

생각건대, 인간의 실체란 것은 아무리 나이를 먹어도 그다지 달라지지 않는 것 같다. - P8

결심 따위는 어차피 인생의 에너지 낭비에 지나지 않는다. - P8

‘별로 달라지지 않아도 돼.‘ 하고 생각하고 있으면, 이상하게 사람은 달라져 가는 것이다. 희한한 일이다. - P9

꿈을 꿀 때마다 몸의 피로가 조금씩 풀려 가는 듯한 느낌이 들었다. - P11

빔 벤더스의 영화 "부에나비스타 소셜 클럽"을 보았다. - P10

짐 자무쉬가 만든 "이어 오브 더 호스"도 닐 영의 콘서트를중심으로 구성된 음악 다큐멘터리로, 특유의 상큼한 맛이 나는 매력적인 작품이었다. - P11

리스토란테(이탈리아 요리 전문의 레스토랑) - P13

일반적으로 말해서 소설가라는 것은 비교적 이상한(도움이되지 않는) 일에 연연해 하는 인종이라고 정의해도 좋을지 모른다. 때로는 별것도 아닌 일에 대해서 궁금해 미칠려고 한다. - P16

인간이란 한 껍질 벗겨보지 않은 다음에야 모르기 때문에, - P28

애매한 것을 어느 정도 안고 있는 쪽이 편한 것도 있다. - P30

말의, 특히 귀로 들리는 음악적인 말의 모든 의미와 관계성이, 큰 형광등으로 비춰질 때처럼, 구석구석까지 깨끗해져 버리면, 그것은 그것대로 뭔가 싱겁지 않을까. 인생에는 어느정도 이해할 수 없는 수수께끼가 필요한 것이다. - P30

세상에는 단 것과 매운 것이 있어서 양자는 서로 협력하며 살아가고 있다는 세계관을 새삼 확인한다. - P33

‘점프하는 자체는 별로 어렵지 않습니다. 어려운 일은 착지를 하려는 시점에서 시작됩니다.‘ _이블 니블(미국의 모험가) - P34

"보기 전에 뛰어라" _오에 겐자부로(大江健三郎) - P35

이탈리아인 운전사들의 특징 가운데 하나는 뭔가 불만이 있으면 이내 창문을 열고 소리를 지르는 것이다. 동시에 손도 휘두른다. 운전하면서 이 짓을 하니 옆에서 보고 있으면 공포를 느낄 수밖에 없다. - P40

‘새삼 절감하는‘ 하나하나가 우리 인생의 골격을 형성해 가는 것은 아닐까. - P41

음식이란 결국 ‘공기‘ 탓인가 보다. 정말 그렇다. - P42

매킨토시는 가장 싼 부류에 속하는 사과 - P44

사과 매킨토시는 Mcintosh이고, 컴퓨터 ‘애플‘은 Macintosh, 상표 관계로 조금 철자가 다르다. - P44

우엉과 당근의 킨피라(역주: 우엉을 잘게 썰어 기름에 볶아 간장 등으로 조미한 요리) - P46

나는 옛날부터 미국의 비교적 심플한 락 음악을 좋아한다. 요즘 마음에 드는 것은 REM이나 레드 핫 칠리 페퍼스나 벡, 윌코. 그들의 신보가 나오면 만사 제쳐두고 레코드 가게에 간다. 쉐릴 크로도 좋다. - P46

에릭 버든과 애니멀즈의 오래된 곡으로 "스카이 파일"이란 것이 있는데, 이것을 계속 틀어 놓고 핸들을 잡고 있으면, 이상하게 기분이 고조된다. 사견이지만, 다차원의 세계에 가 버릴 것 같은 느낌이다. 흥미 있는 분은 시험해 보시길(안전띠를 잊지 않도록). - P47

음악에는 참으로 시추에이션이라는 것이 중요해서, - P47

딱 맞는 음악이 등뒤에서 흐르고 있으면, 작업도 순조롭고 노동 의욕도 솟는다. 그러나 무엇인가를 할 때마다 백뮤직을 골라야 하니, 그것은 그것대로 힘들지도 모른다. - P47

나의 어디까지나 개인적인 의견을 말하자면, 롤 캐비지를 만들 때는 예전에 프린스라고 불렸던 아티스트가 좋을 듯한 생각이 든다. 에릭 크랩튼은 버섯 우동을 만들 때에 좋고, 돈까스는 마빈 게이가 좋을 것 같다. 근거가 무엇이냐고 물으면 몹시 곤혹스럽지만, - P48

(이 원고는 아마데우스 현악 4중주단의 "모차르트 초기 현악 사중 연주곡"을 들으면서 썼다) - P48

‘응원하는 스포츠 팀이 이기면 인간을 건강하게 활성화하는 어떤 분비물이 체내에서 보다 많이 분비된다‘ - P55

인생은 남의 사정과는 상관없이 멋대로 흘러간다. - P57

김밥이란 것은 참 좋다. 여러 가지 재료들이 모두 한 이불을 덮고 있는 것 같아서 보고 있기만 해도 기분이 좋다. - P57

세상 만사에는 우여곡절이라는 게 있지. - P59

좋은 중고 레코드 가게를 찾아내는 가장 좋은 방법은 무조건 그 지방 사람들에게 물어 보는 것이다. 나는 ‘어디 중고 레코드 가게 없습니까? 하고 물으면서 돌아다닌다. 시내 지도를 준비해서 대답을 들을 때마다 그곳을 표시해 나간다. - P61

‘세상은 무대다‘ _셰익스피어 - P63

이만큼의 열의를 좀더 유익한데 썼더라면...... - P63

폴 매카트니도 노래하듯이 인생은 길고 구불구불한 길, 거절할 수 없는 경우도 생기기 마련이다. - P64

누군가가 ‘(트루먼)카포티 씨, 얼굴 사진을 아름답게 찍는 요령이 뭔가요?‘라고 질문하자, 그는 이렇게 대답했다.
‘그건 간단해요. 당신의 머릿속을 아름다운 것으로 가득 채우면 되는 거예요. 아름다운 것만을 생각하는 거죠. 그러면 누구라도 아름다운 얼굴이 찍힐 겁니다.‘ - P65

설령 사소한 것이라도 복수(複數)의 시점에서 실증적으로 사물을 생각하는 것이 중요하다. - P71

도넛 구멍이 처음으로 세상에 등장한 때는 1847년이었고, 장소는 미국 메인 주의 캠딘이라는 작은 마을이었다. 그때 그곳의 어느 빵집에서 핸슨 그레고리라는 열다섯 살짜리 소년이 견습생으로 일하고 있었다. 그 가게에서는 튀김 빵을 많이 만들고 있었는데, 빵 중심에 불이 통할 때까지 시간이 걸려 제빵 효율이 낮았다. 그것을 늘상보고 있던 핸슨 군이 어느 날 빵 한가운데에 구멍을 뚫으면 열 전달이 훨씬 더 빠르지 않을까 생각하고 자신의 생각을 실천에 옮겨 보았다. 그러자 튀기는 시간이 확실히 빨라졌고, 완성된 고리 모양의 그것도 모양은 기묘했지만, 바삭바삭하고 맛있어서 먹기가 좋았다. - P74

드뷔시의 음악 중에 "판화"라는 제목의 곡이 있다. 세 부분으로 나누어지는데, 처음이 탑(파고다)‘, 두번째가 ‘비의 정원‘, 마지막이 ‘그라나다의 밤‘이다. 각각의 이국적인 정경을 인상파 그림처럼 피아노가 멜로디로 세밀하게 묘사해 간다. 아름다운 곡이니 기회가 있으면 꼭 들어 볼 수 있는 기회가 있으면 좋겠다. 나는 고등학교 때 스비아토슬라프 리히터라는 피아니스트의 레코드로 이 곡을 자주 들었다. - P76

인생에는 감동도 수없이 많지만, 부끄러운 일도 그만큼 많다. - P78

상당히 문제가 있는 인간이 상당히 문제가 있는 소설을 쓰고 있다는 것, 누군가에게선가 뒤에서 손가락질을 받아도 어쩔 수 없겠구나 하고 생각한다. 그렇게 생각하면 얼마쯤 마음이 편해진다. 인격과 작품에 대해서 아무리 비난을 받아도, ‘미안합니다. 원래 상당히 문제가 있어서요.‘ 하고 대답할 수 있을 것 같다. - P80

재난은 언제 어디서나 숨을 죽인 채 당신을 기다리고 있다. - P86

세상에는 가르치는 데 서툰 사람이 있기 마련이다. - P90

몇 가진가의 사소한 행운이 잇달아 일어나는 일이 있다. 그런 하루가 있다. - P91

행운이 한꺼번에 거듭된 뒤에는 반드시 그 반향이 돌아온다. 인생이라는 것은 그런 것이다. 정말. - P93

‘호사다마야.‘ - P93

인생에서 괴로운 일은 적을수록 좋은 것이 당연하지 않을까. - P97

뇨키(역주: 이탈리아풍의 수제비) - P98

비상용 산소 봄베(역주: 고압의 기체나 액체를 넣는 강철제의 원통형 용기) - P99

(모든 새로운 편리함은 예외 없이 새로운 종류의 불편함을 낳는다) - P103


댓글(0) 먼댓글(0) 좋아요(13)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo
 
 
 

딥러닝이라는 것은 2개 이상의 은닉층으로 이루어진 신경망을 이용해 학습하는 머신러닝 알고리즘의 집합이다. 오늘 읽기 시작한 부분에서는 딥러닝 개발 이전과 이후 알고리즘 모델을 개발하는 방식의 차이에 대한 얘기가 나온다. 여기서의 핵심은 컴퓨터의 성능이 나날이 좋아짐에 따라 사람의 수고가 획기적으로 줄어들고 오히려 충분한 양의 데이터(빅데이터)를 확보하는 것이 훨씬 더 중요해졌다는 것이다.

딥러닝 이전에는 데이터를 학습하는 알고리즘에 연구자가 직접 적절한 변수들을 설정해야 했다. 예를 들어 이미지를 모델에 넣고 특정 클래스를 예측하는 모델을 만들 때 해당 이미지에 대한 특징feature값(이미지라면 질감, 명암, 색체, 엣지 정보 등)을 일일이 연구자가 설정해야 했던 것이다. 즉, 어떤 특징값을 모델에 넣는지가 모델 정확도를 올리는 데 가장 큰 역할을 했기에 연구자들은 특징값을 추출하는 알고리즘 연구에 매달렸다. - P77

딥러닝 시대에는 원시 데이터 Raw data 자체를 모델에 그대로 넣는다. 이미지를 예로 들면 RGB 픽셀값 원본을 그대로 넣는 것이다. 따라서 데이터 특징값을 추출하는데 들었던 사람의 판단과 노력이 거의 필요 없다. 다른 관점으로 생각하면 충분한 양의 데이터와 성능 좋은 컴퓨터만 있으면 알고리즘 모델을 손쉽게 만들 수 있는 것이다. - P77

임산부들이 임신 초기에 철분이 함유된 영양제를 주로 먹는다는 것을 알고리즘을 통해 알아낸 - P80

랜섬웨어 : 컴퓨터 시스템에 문제가 되는 기능을 실행해 접근을 제한하고 일종의 몸값을 요구하는 악성 소프트웨어의 한 종류다. - P88

지능형 지속 공격Advanced persistent threat, APT : 오랜 기간 동안 지속해서 해킹을 시도해 개인 정보와 같은 중요한 데이터를 유출하는 것 - P88

처음에 취업을 고려할 때는 해당 회사의 주요 고객사를 살펴볼 필요가 있다. 예를 들어 회사의 주요 고객사가 통신사 계열이라면 이동 통신 데이터와 관련한 AI 빅데이터 프로젝트를 접할 기회가 많을 것이다. 즉, 특정 분야의 실력을 쌓고 싶다면 자신이 관심 있어 하는 분야의 고객사를 많이 둔 회사를 찾는게 현명한 선택이다. - P93

외주 개발 프로젝트가 다른 회사의 개발 요청을 위탁받는 것이면 솔루션 개발 업무는 자사의 인공지능 서비스를 직접 개발하는 것이다. - P94

IT 회사 대부분은 회사마다 개발한 솔루션이 있다. 개별적으로 솔루션을 보유하고 있어야 회사 가치도 높아지고 솔루션 공급으로 안정적인 현금 흐름을 창출할 수 있기 때문이다. - P94

솔루션은 하나의 소프트웨어 제품이라고 보면 된다. 우리가 매일 컴퓨터를 켜면 사용하는 워드, 보안 프로그램, 결제 모듈, 메신저 등이 모두 솔루션의 하나고, 각각의 IT 회사가 만든 앱이다. - P94

AI 빅데이터 전문가의 업무는 크게 비즈니스 문제 확인 → 사용 가능한 데이터 파악 → 데이터 전처리(데이터 선택, 정제 및 변환) → 데이터 분석 및 모델링 결과 해석으로 진행된다. - P95

현실적으로 가장 최선의 방법은 프로젝트가 시작되었을 때 해당 비즈니스 분야에 대해서 빠르게 파악하고 문제점을 짚어내는 방법이다. 그러기 위해서는 해당 비즈니스 분야 전문가와의 협업이 필요하다. 비즈니스 분야 전문가의 지도 아래 해당 분야에 대해서 빠르게 익히고, 비슷한 비즈니스 분야에 적용되었던 AI 빅데이터 분석 사례들을 논문 및 서적을 통해서 파악해야 한다. 그 후 해결해야 할 문제점과 프로젝트 목표를 명확히 하고 이를 전체 구성원과 공유 및 합의해야 한다. 이 과정이 끝나야 실제 작업이 이루어지는 것이다. - P97

전체적인 비즈니스 산업에 대한 경영학적 지식, 구성원 사이의 원활한 커뮤니케이션 능력, 빠르게 논문 및 책을 읽어내려갈 수 있는 독해 능력 등이 필요하다. - P97

"많으면 많을수록 좋다" - P98

데이터는 간단한 엑셀 시트, 데이터베이스, 클라우드 서버 등 다양한 형태로 저장되어 있다. 그중 회사 수준의 프로젝트는 데이터베이스에 저장되어 있을 것이다. 데이터베이스는 크게 데이터의 관계를 정의해 저장한 관계형 데이터베이스Relational database, RDB와 다양한 형태의 데이터베이스를 조합해 사용하는 NoSQL로 나눈다. - P98

관계형 데이터베이스와 NoSQL를 관리하는 다양한 데이터베이스 관리 시스템Database management system (이하 DBMS)도 존재한다. 따라서 AI 빅데이터 전문가는 DBMS 별로 데이터를 관리하는 명령을 내리는 쿼리를 익혀야 한다. 물론 DBMS 별 쿼리 사용방법이 비슷하고 현업에서 많이 사용하는 DBMS가 몇 가지여서 처음에 공부를 바짝하면 나중에는 어렵지 않다. - P98

이 단계(사용 가능한 데이터 파악)에서 AI 빅데이터 전문가는 쿼리를 적절히 실행해 다양한 관점에서 데이터를 파악하는 탐색적 데이터 분석 Exploratory data analysis, EDA를 한다. 탐색적 데이터 분석은 데이터별 변수 이름이나 설명 확인, 변수별 기초적인 통계값 확인, 데이터에 이상한 값이나 해당 시점에서 정해지지 않은 값(결측값) 등으로 문제가 있는지 확인, 변수 각각의 값이 예측한 범위나 분포를 갖는지 확인, 변수 사이의 상관관계 등을 살펴보는 과정이다. - P99

데이터 파악이 끝났다면 데이터 선택, 정제, 변환 등을 하는데 이를 데이터 전처리 단계라고 한다. 데이터를 분석할 때 가장 시간 소요가 큰 단계이기도 하다. - P99

특정 기준으로 정리되지 않은 텍스트와 같은 비정형 데이터의 경우는 AI 빅데이터 분석이 가능한 통계값 또는 벡터 형태로 변환해야 한다. - P99

"쓰레기를 넣으면 쓰레기가 나온다garbage in, garbage out"라는 것은 데이터 분석의 기본 전제다. 즉 데이터 전처리를 가볍게 여기면 쓸모없는 결과가 나올 수밖에 없다. - P100

데이터를 제대로 전처리하지 못하는 예는 센서 데이터에서 국가별 시간의 차이를 GMT로 통일하지 않는 경우가 있다. 또는 어떤 변수는 1000, 어떤 변수는 1(K)로 표기하는 것처럼 숫자 단위를 통일하지 않고 들쭉날쭉하게 적용하여 똑같은 값을 제대로 처리하지 못할 수도 있다. 문자나 카테고리와 같은 데이터 타입 전처리 오류도 빈번하게 발생하는 문제점이다. 머신러닝 알고리즘을 적용할 때 변수를 정규화를 하지 않아 알고리즘 모델이 적합fitting 한 상태를 학습하지 못할 수도 있다. - P100

정규화 : 머신러닝의 학습에서 데이터에 있는 특성이 모두 비슷한 영향을 끼치도록 적절하게 값을 바꾸는 것을 말한다. - P100

머신러닝 알고리즘은 크게 지도 학습, 준지도 학습, 비지도 학습, 강화학습 등으로 나누며, 분류, 수치 예측, 군집화 등으로 세분화할 수 있다. 또한 분류에는 서포트 벡터 머신, 트리, 신경망 등이 있고 수치 예측에는 분류에서 소개한 세 가지 알고리즘에 선형회귀가 추가된다. 군집화는 K-평균, 계층적 군집화, 밀도 기반 군집화 Density-based spatial clustering of applications with noise, DBSCAN, 자기조직화지도 self-organizing map, SOM 등이 있다. - P101

파이썬으로 서포트 벡터 머신을 이용한 클래스 분류를 구현해 학습시킬 때는 사이킷런 Scikit-learn 이라는 라이브러리를 활용하면 좋다. - P107

논문에 소개된 모델들을 실제 구현하고 싶다던가, 깊이 있는 딥러닝 모델 네트워크를 구성하고 싶다던가, 자신만의 독창적인 모델을 만들고 싶다면 필연적으로 알고리즘의 원리를 수학적으로 알아야 한다. - P109

AI 빅데이터 분석을 위해서 가장 많이 사용하는 수학 개념은 수리통계학과 선형대수학이다. - P109

머신러닝 알고리즘 관련 책이나 논문을 보면 각종 확률과 분포를 활용하여 알고리즘을 구성하는 경우가 많다. 베이즈 정리 Bayes theorem, 최대가능도추정법 Maximum Likelihood Estimation Method, 카이제곱적합도 검정chi-squared goodness of fit test, 정규분포Normal distribution, 결합분포joint distribution, 주변분포Marginal distribution 등의 용어는 모두 수리통계학을 공부할 때 나온다. - P110

선형대수학Linear algebra은 무엇일까? 역시 위키백과를 찾아보면 "벡터 공간, 벡터, 선형 변환, 행렬, 연립 선형 방정식 등을 연구하는 대수학의 한 분야이다"라고 설명한다. 역시 저자의 관점에서 선형대수학은 딥러닝을 수학적으로 이해하는 데 굉장히 중요한 행렬과 벡터를 공부하는 학문이라고 생각한다. - P110

딥러닝은 신경망 모델을 어떻게 구성하느냐에 따라 무한한 딥러닝 모델이 생성될 수 있다. 따라서 신경망 모델은 정확도를 높일 수 있는 아이디어와 철학을 담고 구성해야 한다. 이때 당연히 수학적 개념이 중요하다. - P111

여러분이 미적분, 행렬, 벡터를 배우지 않았으면 이러한 개넘은 미리 배워두어야 한다. - P111

개념을 이해하는 것이 중요하므로 수학을 공부할 시간이 정말 없다면 인터넷상에 나와 있는 미적분공식, 행렬 및 벡터 연산 법칙을 이해가 되지 않아도 그냥 외우는 것부터 시작하기를 추천한다. - P111

미적분, 행렬, 벡터 등의 개념을 살펴본 후 충분히 공부할 여유가 있다면 강의를 듣는 것이 좋다. 수리통계학이나 선형대수학은 대학교 교과 과정으로 많이 가르치며 유니와이즈, 에듀캐스트, 큐스터디와 같은 인터넷 강의 업체에도 관련 강의가 있다. 보통 과목당 50강 이상인데, 열정을 갖고 열심히 다 들으면 좋다. - P111

네이버에서 제공하는 무크 MOOC 플랫폼인 에드위드 edwith에 무료로 등록된 KAIST 주재걸 교수의 ‘인공지능을 위한 선형대수‘ 나 대표적인 프로그래밍 교육 유튜브인 프리코드캠프freeCodeCamp의 Linear Algebra - Full College Course‘ - P113

데이터 마이닝을 학술적인 용어로 설명하면 통계학에서 배우는 가설검정, 시계열 분석, 선형모델 방법론과 인공지능에서 배우는 신경망, 군집화, 연관성 분석 등을 조합해 가치 있는 데이터를 추출하는 것이다. 쉽게 말하면 수많은 데이터 안에서 패턴을 찾아내어 가치 있는 정보를 뽑아내는 것이다. 그래서 채굴, 채광이라는 뜻을 지닌 ‘마이닝‘이란 단어를 결합한 것이라고 생각한다. 데이터 마이닝과 관련된 방법들은 인공지능 빅데이터 분석의 가장 기본이며 시대와 상관없이 중요한 개념이므로 꼭 알아야 한다. - P115

데이터 마이닝 방법론을 몇 가지 카테고리로 나누면 다음과 같다.

・분류(Classification): 데이터를 미리 구분된 일정한 집단으로 분류한다.

・군집화(Clustering): 전체 데이터를 구체적인 특성을 공유하는 군집들로 나눈다. 군집화는 미리 정의된 특성에 대한 정보를 갖지 않는다는 점에서 분류와 다르다.

・연관성(Association): 동시에 발생한 사건 사이의 관계를 정의한다.

・예측(Forecasting): 데이터셋 안의 패턴을 기반으로 앞으로 나올 수 있는 값을 예측한다.

・이상값 탐색(Oulier): 패턴에 벗어난 데이터를 찾는다. - P116

분류 모델은 최적의 상태로 데이터를 분류하는 y=f라는 함수를 찾는 과정이라고 보면 된다. 이 함수에 사용할 수 있는 알고리즘으로는 결정 트리, 서포트 벡터 머신, 베이즈 분류 등이 있다. - P117

분류는 모델을 구성하는 학습 단계training와 구성한 모델을 통해 주어진 데이터의 클래스 레이블(정답)을 예측하는 분류 단계Classification 로 나눌 수 있다. - P117

주의해야 할 점은 학습 데이터셋으로 모델을 만든 후 다시 학습 데이터셋으로 테스트하면 안 된다는 것이다. 그러면 실제보다 모델 성능이 훨씬 좋게 보일 우려가 있다. 이러한 현상을 과적합Overfitting이라고 한다. 이는 어떤 학생(모델)에게 문제 세트 A (학습 데이터셋)를 공부시킨 후 실제 시험에 같은 문제 세트 A (학습 데이터셋)를 내놓는 것과 같다. 당연히 학생(모델)은 공부한 문제가 나왔으니 실제 실력보다 시험에서 높은 점수를 받을 것이고 진정한 실력이 아님은 모두가 이해할 것이다. - P119

군집화는 데이터 집합을 여러 개의 그룹(군집)으로 나누는 작업을 말한다. 영어로는 클러스터링이라고 한다. 그룹 하나 안에 포함된 데이터들은 서로 굉장히 비슷하며, 다른 그룹의 데이터들과 비슷한 점이 없다. 아무튼 핵심은 유사성을 가려내는 방식이다. 이 유사성은 데이터의 속성값을 이용해 판단하며, 주로 값들을 좌표평면에 나타낸 후 서로 얼마나 가까운 거리에 있는지를 파악하는 방법을 사용한다. - P119

거리 측정법은 유클리디언 거리, 마할라노비스 거리, 민코스키 거리, 코사인 유사도 등 여러 가지가 있다. 어떤 거리 측정법이 좋다고 단정할 수는 없지만 데이터의 특성에 따라 주로 많이 사용하는 거리 측정법이 있다. 예를 들어 텍스트 데이터의 경우 코사인 유사도를 많이 사용한다. - P120

군집화는 보통 시장 조사할 때 비슷한 고객 데이터들을 묶어서 세분화하는 데 사용되곤 한다. 그 결과로 고객 그룹을 세분화하면 각기 다른 맞춤형 마케팅 전략을 펼칠 수 있다. 가짜 뉴스나 스팸 메일을 필터링하는 데도 사용할 수 있다. 가짜 뉴스, 스팸 메일 데이터를 대상으로 군집화를 수행하고 새로운 데이터가 나타났을 때 가짜 뉴스나 스팸 메일이 속한 그룹에 포함되면 가짜 뉴스나 스팸 메일로 필터링하는 방식이다. 비슷한 방식으로 웹 사이트에서 악성 트래픽을 차단하거나 사기/이상 징후 패턴도 군집화를 이용해 파악할 수 있다. - P120

텍스트 문서도 군집화가 많이 활용되는 대상이다. 대량의 문서(ex: 온라인 뉴스)에서 원하는 주제들만 모아서 문서를 보고 싶을 때 자주 활용된다. - P120

군집화는 분류와 다르게 정답에 해당하는 클래스 레이블이 없다. 즉, 비슷한 데이터가 모인 그룹이지만 해당 그룹이 무엇을 의미하는지 명확하게 알 수 없다. 따라서 분류에 비해서는 다소 정확도가 떨어질 수 있지만 애초에 정답에 해당하는 클래스 레이블 데이터가 없는 상황이라면 유용하다. - P120

군집화도 알고리즘에 따라 여러 가지 방법을 선택할 수 있다. 대표적으로 K-평균(K-means), 군집화, K-중앙자(K-medoid) 군집화, 구조적 군집화, DBSCAN, SOM, CLIQUE 등이 있다. - P120

K-평균 군집화는 그룹에 포함된 데이터의 공간상 평균 지점을 그룹의 중앙으로 정의한다. 먼저 전체 데이터에서 임의의 k개의 데이터를 선택한 후 이를 그룹의 중앙에 해당하는 데이터로 정한다. 그리고 나머지 데이터와의 거리를 계산해서 k개 중앙점과 가장 가까운 데이터라면 그룹 안에 포함시킨 후, 해당 그룹의 중앙을 새로 정한다. 다음으로는 새로운 중앙점을 바탕으로 다시 모든 데이터들을 재배치한다. 이 작업을 반복적으로 수행하면 더 이상 반복을 해도 그룹에 속하는 데이터들의 변화가 없어진다. 그럼 알고리즘 실행이 종료되는 것이다. - P121

최적의 k개를 어떻게 정하느냐도 연구 주제다. 실루엣 스코어silhouette score나 엘보 기법Elbow method을 활용한다. 이렇듯 데이터 마이닝은 데이터 각각에 알고리즘이 적용되는 부분이 많아서 공부할 범위가 꽤 방대하다. - P122

연관성은 서로 연관 있는 항목들을 알고리즘을 통해 추출하는 것이다. - P122

고객 4명의 전체 구매 데이터에서 PC를 구매한 사람이 3명, 백신 프로그램을 구매한 사람이 2명이고 PC와 백신 프로그램을 함께 구매한 사람이 2명이라고 생각해보자. 그럼 연관성에서는 전체 구매 데이터에서 모든 상품을 구매한 비율인 지지도support가 50%, 지지도를 PC를 구매한 사람의 비율로 나눈 신뢰도Confidence는 67%라고 할 수 있다. 또한 신뢰도에서 백신 프로그램을 구매한 사람의 비율로 나눈 향상도는 134%다. 보통 연관성에서는 향상도가 100%보다 높으면 서로 연관성이 높다고 여기며 향상도가 정확하게 100%면 독립적인 관계, 100%보다 낮으면 서로 연관성이 낮다고 여긴다. 따라서 컴퓨터와 백신 프로그램은 서로 연관성이 높은 후보군이라고 볼 수 있다. - P123

연관 규칙 분석 알고리즘A priori algorithm이 있다(장바구니 분석이라고도 한다). 모든 데이터를 대상으로 앞에서 설명한 연관성을 계산하기에는 연산 비용이 많이 들기 때문에 이를 좀 더 효율적으로 계산하려는 것이다. - P123

집합 여러 개가 있을 때 P(A)보다 낮은 지지도가 될 것으로 예상되는 A와의 교집합은 아예 지지도, 신뢰도, 향상도를 연산할 때 제외해도 상관없다. 이것이 연관 규칙 분석 알고리즘의 핵심이다. - P124

통계적으로 아웃라이어를 판단하기도 한다. 보통 정상 데이터들을 특정 확률 모델에 따라 추정한 후 새로운 데이터 x를 해당 확률 모델에 적용했을 때 확률밀도함숫값이 작을수록 x가 아웃라이어일 확률이 높다고 판단한다. - P127


댓글(0) 먼댓글(0) 좋아요(13)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo
 
 
 

개인적으로 몇 일 전에 이 책과 제목이 유사한 동 저자의 책을 완독했었다. 다만 그것은 기본편이었고, 오늘부터는 심화편을 읽어보려 한다.

목차를 잠깐 살펴보니 얼추 큰 뼈대는 비슷해보였다. 이후 처음부터 끝까지 대강 훑어봤는데 확실히 기본편 보다는 좀 더 세부적인 내용들이 등장하는 듯하다. 물론 일부 겹치는 부분들도 없진 않겠지만, 말그대로 심화편이다보니 기본편에 플러스 알파가 더해진 느낌이다.

오늘 처음 밑줄친 부분에서 저자는 수학과 통계를 잘 알고 있어야 실제 프로젝트에서 인공지능 모델을 개발할 때 응용할 수 있는 여지가 많아진다고 말한다. 이런 걸 보면 역시 분야를 막론하고 어디서나 기본이 중요하다는 것을 다시금 느끼게 된다.

수학이나 통계를 잘 모르면 모델의 정확도를 높이는 데 중요한 역할을 하는 수치인 하이퍼 파라미터 튜닝의 개념을 이해하지 못한다. 그럼 새로운 데이터를 접했을 때 원하는 정확도를 얻지 못한다. 다른 딥러닝 모델과 결합하여 새로운 모델을 만드는 작업도 할 수 없을 것이다. - P29

AI 빅데이터 분석은 딱 하나의 정형화된 공식이 있는 게 아니다. 데이터의 성격이나 프로젝트 목적에 따라 다양한 형태의 모델을 생성해야 한다. 이때 수학이나 통계학적 지식은 필수다. - P29

컴퓨터를 이용해 알고리즘을 계산하려면 프로그래밍 언어를 이용해 계산에 필요한 원리를 컴퓨터가 알 수 있게 해야 한다. 즉, 인공지능 개발 분야에 맞는 프로그래밍 언어를 찾은 후 해당 언어를 공부해야 한다. AI 빅데이터 분석에 많이 사용되는 프로그래밍 언어는 파이썬 Python, R, 스파크Spark 등이 있다. - P30

티오베TIOBE는 소프트웨어 코드 품질을 관리해주는 업체이다. 꽤 오랫동안 데이터를 수집, 분석했기 때문에 신뢰도가 있는 동향을 파악하는 데 유용한 자료를 제공한다. - P31

AI 빅데이터 전문가는 단순히 수학이나 프로그래밍을 잘하는 데 그치지 않고 전반적인 문제 해결 능력이 있어야 한다. 즉, 어떠한 비즈니스 관점의 문제가 발생했을 때 비기술적인 관점에서 문제의 본질을 파악하고 해당 문제를 해결하는 데 필요한 구체적인 목표를 설정할 수 있어야 한다. - P33

기술적으로 구현한 알고리즘을 통해 어떠한 결과가 나오면 이를 해석해서 비즈니스에 접목할 수 있는 능력도 필요하다. 즉, 단순히 수학적으로 어떤 결과가 나왔다고 끝이 아니라 이를 제대로 해석해서 실제 비즈니스 의사 결정에 어떻게 적용할지도 생각해야 한다. 결과를 타인에게 효과적으로 전달하기 위한 보고서 작성, 의사소통 능력도 필요하다. - P33

산업 분야마다 데이터가 다양할 뿐만 아니라 성격이 다르기 때문에 데이터를 제대로 이해하려면 산업 분야 각각을 대략적으로라도 이해하고 있어야 한다. 실제로 인공지능 개발에 필요한 알고리즘이나 산업 분야의 최신 트렌드는 빠르게 바뀌므로 최신 논문도 항상 읽어봐야 한다. 이를 쫓다 보면 자연스레 영어 독해 능력의 필요성도 느낄 것이다. - P33

여기서 말하는 공부는 꼭 특정 분야의 자료를 읽는 게 아니다. 매일 책, 논문, 신문을 읽고, 여기서 나온 모든 주제가 AI 빅데이터와 어떻게 접목될지 생각해보는 것이다. - P33

AI 빅데이터를 제대로 배우려면 알고리즘에 대한 수학 이론, 데이터 전처리, 직접 프로그래밍하고 이를 직접 변형하는 정도까지 다루어야 한다. - P42

빅데이터란 데이터를 다루는 전통적인 방법이나 도구로 수집, 저장, 분석 등이 어려운 정형 및 비정형 데이터들을 의미한다. 이는 일반적인 컴퓨터에 담을 수 없는 거대한 용량을 의미하기도 하지만 쉽게 처리할 수 없는 다양한 데이터가 동시에 생성되느냐를 의미하는 것이기도 하다. - P52

빅데이터를 설명할 때 가장 많이 언급하는 용어로 3V가 있다. 최근에는 5V로 확장하기도 한다. 3V는 데이터의 양Volume, 데이터 생성 속도velocity, 형태의 다양성variety을 의미한다(O‘Reilly Radar Team, 2012), 이에 덧붙여 정확성veracity과 가치value를 추가로 언급하는 편이다. - P52

이 데이터가 얼마나 신뢰성(trustworthy)이 있는지, 데이터의 품질이 좋은지에 관한 것이 정확성을 따지는 지표가 된다. - P53

데이터 마이닝 기법 : 대규모로 저장된 데이터에서 자동으로 체계적인 통계적 규칙이나 패턴을 분석해 가치 있는 정보를 추출하는 과정을 말한다. - P53

4차 산업혁명에서 언급하는 모든 기술은 데이터 기반으로 이루어진다. 인공지능, 로봇공학, 사물인터넷, 무인 운송, 3차원 인쇄, 나노 기술 모두 빅데이터가 꼭 필요하다. 즉, 빅데이터는 사람에 비유하면 혈관의 피와 같은 존재인 것이다. - P55

AI(Artificial Intelligence)라고 하는 인공지능은 빅데이터가 가장 필요한 분야다. 인공지능의 핵심은 지금까지 사람이 해왔던 의사결정 및 판단을 인공지능 모델로 대체해 더 정확하고 빠르게 자동으로 하는 것이다. 인공지능 모델은 주로 머신러닝과 딥러닝 기술을 활용해서 만들어지는데, 딥러닝의 가장 핵심이 되는 것이 빅데이터다. - P55

머신러닝과 딥러닝은 빅데이터 안의 패턴을 자동으로 인식한 후 새로운 데이터를 대상으로도 정확한 판단을 출력할 수 있도록 하는 기술이다. 따라서 빅데이터 안의 데이터가 다양할수록 훨씬 더 정확한 모델을 갖출 가능성을 지닌다. 데이터가 다양할수록 그 안에 세상의 패턴 또는 정보가 많이 담기기 때문이다. - P55

한 분야의 전문가가 되려면 많은 공부를 해야 하며, 공부량이 늘수록 해당 분야에 대해 박식해진다. 즉, 공부량과 전문성이 어느 정도 비례하기 마련이다. 이 공부량이 인공지능에서는 데이터의 양이라고 말할 수 있다. 데이터를 많이 학습할수록 인공지능 모델이 더 정교해진다. - P55

로봇공학은 언제나 빅데이터를 수집할 좋은 분야이다. 로봇은 감지-계획-행동 세 단계를 반복적으로 실행하는 구조체다. 감지 단계에서는 범위, 위치, 시각, 촉각 센서에서 들어오는 빅데이터를 수집하고 계획 단계에서는 수집된 빅데이터를 활용하여 원하는 목적과 책임을 정한다. 이때 머신러닝이나 딥러닝 같은 빅데이터 분석 방법론이 주로 사용되고 있다. 최근에는 로봇의 시각 센서에 들어오는 빅데이터를 활용해 이미지를 분석하는 딥러닝 기술이 발달하면서 로봇의 의사결정 기능이 더욱 정확해지고 있다. - P56

사물인터넷은 사물 사이의 센싱, 네트워킹, 정보처리 등을 사람의 개입 없이 상호 협력하여 지능적인 서비스를 제공해주는 연결망이다. 우선 센서를 통해 온도, 습도, 조도, 열, 연기, 풍량, 풍향, 초음파, GPS, 영상 등을 수집하여 주변 환경의 물리적인 정보를 수집한다. 최근에 나오는 지능형 센서들은 단순히 원시 데이터raw data를 추출하는 센서의 역할을 벗어나 원시 데이터를 가공한 고차원적인 정보까지 수집한다. 그 후 와이파이Wi-Fi, 블루투스Bluetooth, LTE 등과 같은 네트워크 기술을 통해 사물 사이에서 데이터를 송수신한다. - P57

사물인터넷은 단순히 많은 사물과 기기로 네트워크를 통해 데이터를 송수신하는 것만으로 가치를 만들어내는 것이 아니다. 사물들에게 얻은 데이터들을 분석하고, 분석한 정보를 통해 사용자에게 가치를 주어야 한다. 이 과정에서 당연히 빅데이터 분석과 인공지능 기술이 필요하다. - P57

라이다 : 레이저 광선을 발사하고 그 반사와 흡수를 이용하여 대기 중의 온도, 습도, 시정(視程) 따위를 측정하는 다목적 대기 현상 관측 장치를 말한다 - P58

빅데이터 분석 역시 다양한 데이터 속 패턴을 찾아 고객 맞춤형 서비스를 제공하기 위한 방편으로 활용하는 것 - P58

나노 기술은 나노미터(10억분의 1미터)에 근접한 원자 정도 단위에서 물질을 합성, 조립, 제어하는 기술을 말한다. 나노 기술의 발달로 초미세 단위 물질에 대한 접근이 가능해졌고, 여기서 파생되는 데이터도 수집할 수 있게 되었다. 이러한 데이터는 기존에 얻지 못했던 데이터이기 때문에 빅데이터 분석 및 인공지능 모델에 사용되면 그전에 보지 못했던 새로운 물질에 대한 인사이트를 얻는 데 효과적이다. - P59

빅데이터 분석을 통해서 전체적인 윤곽을 본 후 사람의 판단과 이론을 접목해서 향상된 알고리즘을 만들어야 한다 - P60

진정한 빅데이터 분석은 분석가가 끊임없이 사고하고 연구하면서 본인 혹은 다른 연구자가 세운 이런저런 이론에 대한 가설을 실험해 보아야 하는 것이다. 이 과정에서 과거에 보지 못했던 새로운 인사이트를 도출해내고 이를 미래에 활용할 수 있는 방향을 찾게 되는 것이다. - P61

데이터 3법의 핵심은 개인 정보의 일부를 삭제하는 방법으로 특정 개인을 알아볼 수 없도록 처리한 가명 정보를 동의 없이 금융, 연구 목적 등에 사용할 수 있다는 점이다. - P61

초개인적 : 개인의 의식 상태를 초월하여 집단적 무의식의 상태를 지니는 것 - P61

개인 수준에서는 회사에 개인 정보가 수집되는 과정, 개인 정보가 활용되는 목적, 개인 정보가 공유되는 대상을 요구해 면밀히 살펴야 한다. 기업에서 보유하는 개인 정보 열람은 ‘개인정보보호법 제35조‘에 따라 요구할 수 있는 당연한 권리이기도 하다. - P62

인공지능이 가장 최상위 개념이고 그다음에 머신러닝, 그다음에 딥러닝이 포함되는 개념이다. - P63

인공지능은 시스템으로 만든 지능을 갖는 컴퓨터 시스템 모두를 총칭하는 개념이다. 즉, 요즘에 주목받는 딥러닝, 머신러닝, 빅데이터가 꼭 들어 가야 하는 게 아니다. - P64

80년대 유행했던 전문가 시스템 Expert System은 인공지능의 응용분야에 해당한다. 전문가 시스템은 해당 도메인의 전문가 집단이 설정한 논리적인 조건들을 모두 컴퓨터에 구현한 것이다. 즉 수많은 if-then-else 조건문으로서 세상의 법칙을 설명하려 한 것이다. - P64

if-then-else 조건문 : ‘만약-그래서-아니면‘이라는 조건에 따라 논리를 설계하는 프로그래밍 언어의 개념 - P64

기존의 전문가 시스템이 전문가가 도출한 수많은 규칙에 의해서 동작했다면 머신러닝과 딥러닝은 데이터 기반 학습으로 규칙과 정답을 추론한다. 즉, 전문가 집단의 지식이 거의 또는 아예 필요 없게 되었다. - P66

이제는 사람의 지식보다는 얼마나 많은 양질의 데이터셋을 갖느냐가 경쟁력이 되었다. 데이터는 4차 산업혁명 시대의 원유인 것이다. 이에 따라 데이터의 부익부빈익빈 현상이 가속화되고 있다. - P67

머신러닝은 머신이 스스로 학습해 어떤 일을 처리하는 알고리즘 모델을 만드는 것이다. 사람이 지식을 습득하면 인지, 판단, 유추와 같은 사고를 할 수 있는 것처럼, 머신에게 데이터를 학습시켜 사람처럼 판단을 할 수 있는 사고 모델을 내놓는 것이다. - P68

딥러닝은 머신러닝의 하나로 스스로 학습해 알고리즘 모델을 만드는 네트워크가 깊은 계층으로 이루어겼다는 차별점이 있다. - P68

머신러닝은 크게 지도 학습 supervised Learning과 비지도 학습Unsupervised Learning으로 나뉜다. 더 자세히 살펴보면 준지도 학습Semi-Supervised Learning, 강화 학습 Reinforcement Learning, 원샷 학습 One-shot Learning 등으로 나눌 수 있지만 - P69

지도 학습이란 정답을 이용하여 알고리즘을 학습하는 방법이다. 머신러닝의 지도 학습은 학습에 필요한 데이터를 수집할 때 정답(정답을 레이블 label 혹은 타깃 target이라고 함)을 두고 학습하는 방법이다. 물체 이미지 분류 알고리즘을 학습하기 위해서는 어떤 물체를 무엇으로 분류할지에 대한 정답이 꼭 있어야 하는 것과 같다. - P69

MNIST, CIFAR-10, IMDB review, Reuters newswire와 같이 연구 목적으로 공개된 데이터들 - P70

지도학습의 과정을 간단히 살펴보면 데이터를 알고리즘에 입력하고 나온 출력값을 정답 데이터와 비교해서 오차를 확인한 후 이를 줄여나가는 방식이다. - P70

빅데이터를 이용해 학습하면 머신러닝 알고리즘의 가중치가 가장 최적화되며, 학습 데이터 이외의 새로운 데이터를 사용해도 실제 정답과 비슷한 출력 결과를 내놓는 것이다. - P70

학습 과정에서 사용하는 수학적 개념으로는 분류classification 와 회귀Regression가 있다. 분류는 알고리즘이 개, 고양이를 맞추는 것처럼 일정한 유형을 판단하는 개념이다. 회귀는 알고리즘이 가격이나 몸무게를 예측하는 것처럼 최대한 정확한 숫자를 나타내는 개념이다. 따라서 분류냐 회귀냐에 따라 정확도 측정 방법, 알고리즘 학습에 사용하는 오차 함수나 활성화 함수 등이 다르다. - P71

비지도 학습은 지도 학습과 반대로 데이터를 이용해 학습할 때 정답이 없는 경우다. - P71

비지도 학습은 데이터의 패턴을 알고 싶거나 데이터를 압축, 축소할 때 사용한다. - P71

데이터 패턴을 구하는 가장 대표적인 예는 군집화clustering 다. 군집화는 전체 데이터를 비슷한 패턴을 지닌 몇 개의 그룹으로 나눈다. 각각의 그룹이 정확히 무엇인지는 정답은 없지만 일정 패턴에 따라 나누다 보면 서로 비슷한 데이터가 그룹으로 묶이는 것이다. - P71

데이터를 압축, 축소해주는 비지도 학습 예에는 오토인코더Autoencoder와 주성분 분석 Principal component analysis, PCA(이하 PCA)가 있다. 둘 다 다수의 차원으로 구성된 데이터를 압축, 축소해서 소수의 차원으로 변환한 후 시각화를 통해 데이터의 패턴을 파악하거나 노이즈를 제거하는 것이다. 여기서 말하는 시각화란 예를 들어 10차원의 데이터를 10차원 그대로 나타낼 수 없으므로 사람이 알 수 있는 2차원 또는 3차원으로 변환하여 표현하는 과정을 말한다. - P72

딥러닝이란 2개 이상의 은닉층 Hidden layer으로 이루어진 신경망 Neural network을 이용해 학습하는 머신러닝 알고리즘의 집합이다. - P73

신경망은 생물학의 신경(뉴런)이 네트워크를 이뤄 신체를 제어하는 각종 정보를 교환하는 개념을 컴퓨터 연산에 도입한 것이다. - P73

머신러닝에도 다층 퍼셉트론Multilayer perceptron, MLP이라는 알고리즘이 있다. 이는 데이터의 입력값과 출력층 사이에 은닉층을 두어 학습할 때 필요한 최적의 가중치를 계산한다. 하지만 복잡한 모델을 구성하기 위해서는 은닉층 1개로는 부족하기에 2개 이상의 은닉층으로 구성한 모델들이 생겨났고 이를 딥러닝이라고 부르기 시작한 것이다. - P74

딥러닝은 신경망을 어떻게 구성하냐에 따라서 심층 신경망Deep neural network, DNN, 합성곱 신경망Convolution neural network, CNN, 순환 신경망Recurrent neural network, RNN, 장단기 메모리 Long short-term memory, LSTM, 게이트 순환 유닛Gated recurrent unit, GRU, 오토인코더, 어텐션 메커니즘Attention mechanism 등 여러 가지로 나눌 수 있다. 또한 세부 파라미터를 어떻게 설정하느냐에 따라 모델 각각을 다시 여러 가지 방식으로 만들 수 있다. - P75


댓글(0) 먼댓글(0) 좋아요(14)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo