이 책에 대한 지난번 포스팅에서 저자는 데이터 관련 자격증이 실제 현업에서 그다지 도움이 되지 않는다고 말했고, 오늘 읽기 시작한 부분에서는 이러한 저자의 주장에 대한 근거가 나온다. 핵심 요지는 자격증 시험에 나오는 데이터의 양은 비교적 한정되어 있고 그 형태가 상당부분 정형화 되어있지만, 실제 현실에서는 처리해야 할 데이터의 양이 기하급수적으로 증가할 뿐만 아니라 비정형 데이터들도 많은 관계로 그러한 데이터를 처리하기 위한 전처리 과정이 상당부분 필요한데 자격증만으로는 이러한 실무적인 문제들을 해결하는 것이 어렵다는 것이다.

결국 어느 분야든 마찬가지겠지만 자격증을 몇 개 가지고 있다는 것은 전문가로 성장하기 위한 출발점 정도에 서는 것이고 이후 실전에서 부딪치면서 배우고 성장하면서 소위 말하는 진짜 전문가로 발돋움해나가는 것이라고 할 수 있겠다.

센서 데이터 같은 경우는 초단위로 데이터가 계속 들어오기 때문에 대용량 데이터에 속한다. 따라서 아파치 하둡이나 스파크를 이용해서 처리해야 하는 경우도 발생한다. 하지만 이런 것들은 자격증을 취득한다고 배울 수 있는 것이 아니다. - P85

자격증을 취득해도 실무에는 거의 도움이 안 된다고 보면 된다. 자격증은 그저 맛보기 식의 개론만 살짝 보는 정도다. 그럼에도 불구하고 자격증을 공부하는 것은 반대하지 않는다. 공부해서 나쁠 것은 없기 때문이다. 대신 최대한 빠르게 한번 훑고 넘어가는 게 좋다. 굳이 자격증을 안 따도 된다. 한번 훑고 넘어가는 수준으로만 공부해도 충분하다. 자격증을 굳이 따려고 완벽하게 책을 외우는 어리석은 짓은 시간낭비일 뿐이다. - P85

비정형 데이터(비정형 정보; unstructured data, unstructured information)는 미리 정의된 데이터 모델이 없거나 미리 정의된 방식으로 정리되지 않은 정보를 말한다. 이에 따라 전통적인 데이터베이스의 레코드, 필드 형태의 폼으로 저장하기가 불가능하다. - P85

연구조사에 따르면 전체 데이터 중 약 80퍼센트 이상이 비정형 데이터로 이루어져 있다. 즉, 비정형 데이터를 잘 처리하고 분석하는 능력이 AI 빅데이터 분석가의 핵심 능력으로 평가받을 수 있다. - P85

데이터 분석 방법론, 각 알고리즘에 대한 이해, 데이터 수집 및 저장 능력, 데이터 전처리 및 모델링하는 방법, 시각화하는 능력, 분석 결과 보고서 작성 능력 - P88

서버단 작업, API 작성, 분석 솔루션 UI로 나타내기와 같은 조금 더 고급화된 능력 - P88

IBM 모델러, 래피드마이너, 나임과 같은 툴을 이용해서 실습하는 교수들도 많다. 이러한 툴의 문제점은 데이터 전처리가 이미 다 끝난 예제 데이터 세트에서만 작동한다는 사실이다. 또한 대용량 데이터에서는 해당 툴이 작동하지 않을 수도 있다. 뿐만 아니라 각 모델 파라미터를 튜닝하거나 모델을 결합, 수정하는 것이 매우 어렵거나 불가능하다. 따라서 이러한 툴은 실전에서 거의 쓰이지 않는다. 그냥 레고 블록처럼 교육용으로 데이터를 가지고 놀기에만 적합할 뿐이다. - P89

텍스트 마이닝은 SNS 등 각종 온라인 플랫폼에서 수집되는 방대한 양의 텍스트 안에서 인사이트를 도출할 때 주로 쓰이는 방법론이다. - P92

추천 알고리즘은 아마존닷컴, 넷플릭스, 유튜브 등에서 많이 쓰는 방법이다. 흔히 말해 개인의 과거 로그 데이터를 기반으로 향후 해당 사용자가 좋아할 만한 콘텐츠를 추천해주는 것이다. - P92

AI 빅데이터 분석을 위해서는 CPU, RAM, GPU 등의 성능이 일반 컴퓨터보다 월등히 좋아야 한다. 개인 사비로 이러한 장비를 충당하기에는 쉽지 않은데 회사에서는 상대적으로 고사양 PC 또는 서버를 제공해주어서 일의 능률이 올라갈 수 있다. 또한 상대적으로 개인이 접하기 어려운 데이터를 다루어볼 수도 있다. 회사 내부 데이터, 회사 고객 데이터 등을 일하면서 다루어볼 수 있는 기회를 얻을 수 있다. - P95

당신이 처음부터 끝까지 해야 한다. 데이터 전처리, 데이터 모델링 및 분석, 결과 보고서까지 혼자 힘으로 해야 한다. 주변에 알려줄 사람은 아무도 없고, 물어봐도 아는 사람도 없다. - P96

경험상 혼자 관련 논문을 읽고 아이디어를 얻어 데이터를 분석하는 게 가장 빠르고 효과적이었다. - P97

AI 빅데이터 전문가는 말 그대로 자기만의 전문 분야가 있어야 한다. 특정 세부 분야에 대해서 깊이 파고, 그 분야의 대가가 되어야 하는 것이다. - P98

회사 방침에 따라 또는 회사 문화상 특정 언어로 코딩을 짜야 하는 경우가 있다. R, 파이썬, 스파크, 자바, C 또는 SAS, IBM 모델러, 래피드마이너와 같은 특정 툴을 요구하는 경우도 있다. 나는 내가 원하는 언어로 코드를 짜고 싶어도 팀원 간에 협업을 요구하기에 특정 언어로 맞추어서 일을 하는 경우가 많다. - P99

사실 언어는 한두 개 정도만 하면 된다. 코딩 능력이 AI 빅데이터 전문가로 인도하는 것은 아니다. 개인적으로 파이썬, R 정도면 충분하다고 생각한다. ‘스파크‘는 배우면 좋지만 굳이 공들여 배울 필요는 없다. - P99

회사 방침상 별로 필요도 없는 IBM 모델러, SAS 같은 툴이나 자바, C와 같이 데이터 분석에 맞지 않는 언어를 배울 필요는 더더욱 없다. - P99

하둡을 이용한 데이터 적재, No-SQL DB 구축과 같은 일도 할 수 있다. 물론 데이터 엔지니어로서 해당 일들을 해보면 나쁘진 않다. 하지만 만약 이러한 일들만 계속해서 회사에서 시킨다면 분명 문제가 생길 것이다. AI 빅데이터 전문가가 되기 위한 핵심 알고리즘 연구할 시간은 없고 중요하지도 않은 일만 몇 달간 계속해서 할 것이다. - P99

회사에서는 자신의 흥미와 적성에 맞는 연구를 할 수 없다. 회사의 이윤 창출에 도움이 되는 연구 또는 기술에 당신이 맞추어질 뿐이다. - P99

모든 공부가 마찬가지겠지만 AI 빅데이터 공부도 역시 재미가 있어야 한다. 재미가 있으려면 역시 단순 암기나 읽기보다는 공부하며 깨닫는 즐거움이 있어야 한다. - P100

AI 빅데이터 관련 공부를 하다 보면 새로운 것을 이해하거나 새로운 모델을 만들었을 때 엄청난 희열을 느낄 수 있다. - P101

특정 알고리즘에 대해서 로직을 완벽히 이해했다거나 논문에 구현된 모델을 이해하고 실제 코드로 구현해봤을 때 희열을 느낄 수 있다. 또는 자신이 직접 모델을 수정, 개량해볼 수도 있다. 이는 바로 논문 게재로도 이어질 수 있어 뿌듯함이 배가될 수 있다. - P101

k-평균 알고리즘(K-means algorithm)은 주어진 데이터를 k개의 클러스터로 묶는 알고리즘으로, 각 클러스터와 거리 차이의 분산을 최소화하는 방식으로 동작한다. 이 알고리즘은 자율 학습의 일종으로, 레이블이 달려 있지 않은 입력 데이터에 레이블을 달아주는 역할을 수행한다. - P102

k-평균 알고리즘의 기본 동작법, k-평균 알고리즘의 초기화기법, 거리 구하는 공식, 클러스터 수를 구하는 방법, k-평균 알고리즘의 변형 알고리즘 - P102

AI 빅데이터를 공부하기 위해서는 책, 논문, 강의, 구글링 등 수많은 방법이 있다. - P103

학원 온라인 강의 또는 해외 대학교의 강의를 무크로 들을 수도 있다. - P104

《지능정보연구》저널이 AI 빅데이터 알고리즘에 대해서 전반적으로 많이 다루고 있으며 실제 비즈니스 현장에 적용할 수 있는 사례들을 많이 다루고 있어 쉽고 재밌다. - P105

그냥 내가 편하고 잘하는 것을 좋아하는 방법으로 공부하면 그게 강점이 되는 것이다. - P105

코딩을 배우다 보면 자신에게 잘 맞는 언어가 있다. - P106

심지어 파이썬을 써도 분석 환경으로 주피터 노트북, 주피터 랩, 스파이더, 파이참, 스파이더 중에 무엇을 쓰는 게 좋은지 물어보는 사람도 있다. 그냥 자신이 편한 것을 쓰면 된다. 아무거나 써도 내가 편하고 잘하면 아무런 문제가 없다. - P106

자신이 편하고 쉬운 게 무엇인지 파악하고 그것만 하면 된다. 이런 과정을 계속 하다 보면 자신에게 맞는 공부법 및 분야를 발견할 수 있고 이를 계속 갈고 닦으면 전문가가 되어 있을 것이다. - P106

기본기가 탄탄해야 진짜 전문가가 된다 - P109

개념과 원리를 이해하는 방법으로 공부해야 제대로 된 전문가가 될 수 있다. - P111

데이터마다 그 구조가 워낙 다양하고 모델 및 알고리즘들도 새로운 게 계속해서 나오고 있다. 굳이 유형이 있다면 딥러닝 네트워크 모델들을 유형화해서 DNN, CNN, RNN, 오토인코더autoencoder 등이 있고 해당 유형의 모델들을 조금씩 수정해서 얼추 좋은 정확도를 구할 수는 있다. 그러나 이것도 역시 데이터마다 전처리 및 모델의 입력 부분을 달리 해야 하고 더 높은 정확도를 구하기 위해서는 모델 구조 수정 및 하이퍼 파라미터 튜닝이 필요한데 개념과 원리를 알지 못하면 절대 할 수 없는 부분이다. - P112

AI 빅데이터 전문가가 되기 위해서는 실제 산업 현장에서 나오는 데이터를 이용해 분석해야 한다. 또한 높은 정확도와 예측력을 지니는 모델을 고안하기 위해서 더욱 머리를 짜내야 한다. 이 모든 과정이 평소에 공부할 때 개념과 원리에 집중해야 할 수 있는 부분이다. - P112

완전히 제로베이스에서 새로운 모델을 만드는 경우는 없다. 모두 기존에 만들어진 알고리즘에서 시작해서 무언가 새로운 모델을 만드는 것이다. - P113

결국 처음에 공부를 시작할 때 각각의 알고리즘의 동작 원리를 차근차근 이해하며 넘어가야 한다. 구체적인 수식들에 대해서도 이해하면 사실 더 좋긴 하다. 하지만 수식 하나하나를 유도하고 증명하는 과정까지 공부하기가 힘들면 ‘어떤 동작 부분에서 어떠한 수식이 어떠한 이유로 쓰인다‘ 정도는 알아야 한다. - P113

AI 빅데이터 공부를 하며 개념원리를 익히기 위해서는 교수의 실력, 자질과는 무관하게 무조건 스스로 해야 한다. - P114

최고급 전문가 정도의 경지가 아니라 준전문가 되기 위해서도 누군가에게 의지하기보다는 스스로 공부해야 한다. - P114

AI 빅데이터 분야는 그 세부 분야가 너무나도 많이 뻗어 있다. 그리고 전문가가 되기 위해서는 그 세부 분야 중에 하나를 잡고 그 분야만을 깊게 파야 한다. - P115

결론은 혼자 공부해야 한다는 것이다. 어쩔 수 없다. - P116

혼자 공부하면서 생각하고 이해한 다음에 또 응용해보는 것이다. 그러다 보면 결국 그게 당신의 관심 분야가 되고 그 분야에 대한 전문가가 되는 것이다. 전문가로 인정받기는 매우 쉽다. 당신이 이해하고 깨달은 것을 조금 수정하고 변형하는 식으로 응용해서 저널에 논문을 투고해도 되고 또는 그냥 이해한 자체를 책으로 써내도 된다. - P116

학원에서는 수학적 알고리즘에 대한 설명, 실제 산업 현장에서의 문제점 발견 및 데이터를 이용한 문제 해결 목표 제시, 구체적인 데이터 전처리 및 모델링 방법 등은 알 수가 없다. - P118

전반적인 데이터 분석 방법론들을 익힌 후에는 자신만의 연구 분야를 선정한 후 그것만 깊이 파야 한다. - P119

데이터 분석 목적 및 모델링 방향 제시를 할 수 있는 능력을 키워라 - P121

SVM 함수는 패키지에서 제공해주는 가장 기본적인 파라미터로 실행이 되지만 데이터의 성격과 분석 목적에 따라 파라미터를 사용자가 수정해주어야 할 수도 있다. 또는 단순히 SVM 함수를 갖다 쓰는 게 아니라 알고리즘을 수정 및 변형하기 위해 코드를 직접 짜기도 한다. 이러한 작업이 전문가의 영역이라고 할 수 있다. 이러한 일들을 하기 위해서는 역시 알고리즘 각각에 대한 개념원리와 수학적인 지식이 필요하다. - P122

데이터 분석에서 데이터 전처리 작업이 전체 작업 시간의 70~80퍼센트에 달한다. - P122

전문가에 요구되는 가장 중요한 능력 중에 하나가 비즈니스 현장의 문제를 인식하고 데이터가 주어졌을 때 주어진 데이터로 어떻게 비즈니스 문제를 풀 것인가 고민하는 능력이다. - P122

문제 인식은 데이터 분석의 첫 단추로 불리고 가장 중요한선행 단계로 분류된다. 이 단계에서 큰 숲을 잘 정리하고 세부적으로 데이터 분석을 실행해나가야 한다. 그렇지 않고 제대로 된 문제 인식 없이 처음부터 이상한 방향으로 분석을 시작하면 아무리 분석을 열심히 해도 실제 비즈니스 현장에는 쓸모가 없다. - P122

데이터를 이해하기 위해서는 데이터의 흐름 파악이 필요 - P123

다양한 프로젝트를 접하고 인문, 경영, 사회 쪽의 문제들도 신문, 잡지, 책을 통해 다양하게 살펴보면서 안목을 넓히는 게 중요하다. - P123


댓글(0) 먼댓글(0) 좋아요(12)
좋아요
l 공유하기 l 북마크하기찜하기 lthankstoThanksTo