AI 빅데이터 전문가가 되기 위해서는 우선 가장 기본적으로 코드를 작성할 줄 알아야 하며 분석 결과를 이해관계자들이 모두 이해할 수 있도록 스토리텔링을 할 수 있는 능력도 필요하다. 또한 모델을 구축하기 위해서는 수학, 통계학적인 지식도 필요하다. 즉 컴퓨터, 경영학, 언어학, 수학 등 복합적인 학문을 두루갖춘 융합 인재인 것이다. 이러한 융합 인재이기에 21세기에 가장 섹시한 직업으로 꼽히는 것이다. - P20
AI 빅데이터 전문가는 구하기도 힘들고 고용하기도 어렵다. 과학적 지식, 컴퓨터공학적 스킬, 분석 능력을 두루 갖춘 사람은 매우 드물다. 따라서 이러한 인재에 대한 갈급함은 앞으로도 심화될 것이다. - P20
이제 데이터는 분야를 막론하고 어디서나 보편적으로 쏟아져 나오며 이를 활용하고 대응할 수 있는 능력을 가진 기업만이 살아남을 것이다. 또한 양질의 데이터가 많을수록 뛰어난 모델을 생성할 수 있어 데이터가 곧 부와 직결될 것이다. 한편으로는 데이터에 대한 부익부 빈익빈 현상이 가속화될 수 있다. - P24
미래는 데이터 확보가 기업의 중요 경쟁분야가 될 것이다. 그리고 이러한 데이터를 이용해 우수한 모델을 만들고 인사이트를 도출할 다수의 AI 빅데이터 전문가가 필요할 것이다. - P24
수학, 통계학, 경영학 지식까지 함께 함양해야 하는 AI 빅데이터 전문가의 특성상 일반 학원에서 코딩 몇 줄 배운다고 절대 전문가가 되지 않는다. - P37
웹 개발자 같은 경우는 UI 설계서를 받으면 그대로 구현하면 끝이다. 하지만 AI 빅데이터 전문가는 UI 설계서 같은 게 없다. 데이터 분석의 첫 단추는 기업 문제 Business problem의 정의에서 시작한다. 소위 말해 숲을 보고 세부적인 나무로 들어가는 방법이다. 기업 문제를 정의하면 그 문제를 해결하기 위해 데이터를 통해 인사이트를 찾아나가는 방식이다. 솔직히 말하면 꽤 모호하다. - P43
사전에 규격화되거나 정해진 것이 없다. 기업 문제 해결을 위해 데이터를 받으면 데이터를 정제 후 여러 번의 실험을 거쳐 분석결과를 도출, 시각화한 후 의사 결정에 접목해야 한다. 마치 기업 최고경영자가 하는 일과 같지 않는가? AI 빅데이터 전문가는 기업 최고 의사결정에 핵심적인 역할을 수행한다. 단순한 노동 IT인력이 아니라 데이터를 통해 의사 결정을 수행하는 경영자적 역할을 하는 것이다. 이 과정에서 엄청나게 많은 능력이 필요하다. - P43
우선 데이터에 대한 지식이 필요하기에 데이터베이스에 대한 사전 지식이 필요하다. 과거 RDB뿐만 아니라 최근에 많이 쓰는 No-SQL까지 알아야 한다. 또한 이와 관련해서 서버에 대한 지식도 어느 정도 필요하다. 데이터베이스 및 데이터가 서버에 적재되어 있는 경우가 대다수고 분석도 데스크톱보다는 서버에서 이루어져야 효율이 높다. 솔루션이나 API 제작 같은 경우도 다 서버에서 이루어진다. 데이터 전처리 및 가공능력은 당연히 필수적이다. 또한 수학, 통계학적 지식이 있어야 이를 응용해 가공된 데이터로 모델을 만든다. - P44
이러한 과정은 다 코딩으로 이루어지는데 파이썬 Python, R, 스파크Spark와 같은 언어들이 주로 쓰인다. 각 언어마다 각기 장단점이 있기에 한 가지 언어를 알기보다는 최소 두 개 이상은 구현하는 게 좋다. - P44
분석을 마친 이후에는 결과를 더 잘 알아보기 위해 시각화를 해야 한다. 분석 결과를 보고서로 작성할 때에는 인문학적 언어 능력, 경영학적 능력도 필요하다. 분석 결과를 자동화 솔루션으로 제작하기 위해서는 웹 개발 능력까지 필요하다. 마지막으로 사람들 앞에서 결과를 전할 때에는 뛰어난 의사소통 능력까지 요구한다. 이렇듯 다방면에 엄청나게 많은 지식과 능력이 있어야 AI 빅데이터 전문가로서 어필할 수 있다. - P44
프로젝트를 할 때마다 필요한 인력을 외주 또는 프리랜서로 해결할 수 있다. 외주 인력, 프리랜서를 구하는 방법은 너무나 쉽다. 크몽, 위시켓, 프리모아, 오투잡 등 인터넷 플랫폼을 이용하면 쉽게 구할 수 있다. - P48
AI 빅데이터 전문가가 창업을 하게 되면 각종 정부지원 사업의 혜택을 누릴 수 있다. 4차 산업혁명 시대를 맞이해 정부 예산이 AI에 집중되고 있다. 따라서 AI 빅데이터 관련 아이템으로 정부 사업에 초기 창업 지원을 신청하면 너무나 쉽게 초기자본을 받을 수 있다. 5,000만 원에서 1억 원 정도는 쉽게 받을 수 있다. 이 정도면 초기 자본으로는 큰 문제가 없다. - P49
또한 창업 이후에도 각종 정부 지원 사업에 참여하면서 계속해서 이익을 창출할 수 있다. 엔젤투자, 엑셀러레이터 등의 투자도 받을 기회가 널려 있다. 사무실을 정부에서 지원해주기도 한다. 혼자서 일할 때는 굳이 사무실이 필요치 않지만 직원을 뽑게 되면 사무실이 필요하게 된다. 사무실 임대료가 부담될 수도 있는데 정부 지원 사업을 잘 찾아보면 사무실도 쉽게 지원받을 수 있다. 코워킹 스페이스부터 독립된 공간까지 지원받기가 어렵지 않다. - P49
정부 지원을 받으려면 서류 작업이 좀 번거로울 수는 있지만 약간의 수고만 감수하면 그 이후의 혜택이 무궁무진하다. - P50
조금만 꼼꼼하고 규칙적으로 정부 사업 공고를 확인하고 서류 작업만 충실히 수행한다면 창업자 대다수가 혜택을 받을 수 있다. 왜냐하면 AI 빅데이터 관련 정부 사업이 너무나 많고 이를 활용하는 창업자들은 많지 않기 때문에 상대적으로 경쟁률이 낮기 때문이다. - P50
AI 빅데이터 전문가의 최대 장점은 전 분야에 걸쳐서 접목이 가능하다는 것이다. - P50
현대 사회는 어느 분야나 데이터가 쏟아져 나오고 있어 데이터를 활용할 수 있는 능력이 요구된다. 더군다나 앞으로는 클라우드, 사물인터넷, 센서 등의 발달로 이러한 현상은 더욱 증가할 것이다. 그러면 기하급수적으로 쏟아져 나오는 데이터와 이를 활용할 수 있는 능력이 요구되기 때문에 AI 빅데이터 전문가는 필수적이다. 그리고 이들은 모든 분야에서 중요하게 요구된다. - P51
의료, 관광, 요식업, 법률, 재무, 회계, 제조, 유통 등 어느 분야든지 AI 빅데이터가 필요하다. 따라서 창업하기 위한 아이템도 무궁무진하다. 각 분야마다 AI 빅데이터를 섞기만 하면 새로운 창업 아이템이 탄생한다. 왜냐하면 아직까지 AI 빅데이터를 접목한 사업 사례가 많지 않기 때문에 그냥 결합만 해도 새로운 아이템이 된다. - P51
AI 빅데이터 전문가는 직종 특성상 협업을 하는 프로젝트가 대다수다. - P56
데이터를 받고 적절히 전처리한 후 결과가 잘 나오는 모델을 만들면 끝이다. - P57
데이터 분석 알고리즘의 특성상 몇 가지 반복적으로 많이 쓰이는 알고리즘들이 있기 때문에 복사가 가능하다. 즉 A프로젝트에서 수행한 코드를 조금만 바꾸어서 B 프로젝트에 적용해서 쓸 수 있다는 것이다. - P57
데이터 마이닝 책을 보면 몇 가지 알고리즘이 공통적으로 보인다. 예를 들어 지도 학습, 비지도 학습이 있고 지도 학습에는 분류 분석, 회귀 분석이 있으며 비지도 학습으로는 군집 분석, 연관 규칙이 있다. 그리고 그 아래 세부 알고리즘을 살펴봐도 몇 개 안 된다. 요새 많이 쓰이는 딥러닝도 DNN에서 파생된 RNN, LSTM, CNN, GAN 등 몇 개 쓰이는 알고리즘 안에서 계속 되풀이된다. - P57
자신이 예전에 짠 코드를 그대도 써도 되고, 구글링해서 나온 코드를 그대로 써도 되고, 그것도 싫으면 라이브러리의 함수를 그대로 쓰면 된다. 절대 도덕적으로 비윤리적이거나 범법 행위가 아니다. 그저 빠르고 쉽게 일을 처리할 수 있는 요령이다. - P58
물론 프로젝트마다 데이터가 다르기 때문에 처음에 데이터 전처리 부분은 어쩔 수 없이 그때그때 해야 한다. 하지만 전처리부분만 끝나면 그다음부터는 그냥 복사해서 붙여넣기만 하면 된다. 꽤 단련이 되다 보면 한 시간 정도 만에 일을 끝내고 프로젝트 한 개를 완수하는 경우도 종종 있다. - P58
AI 빅데이터 전문가로서 경력을 쌓아가는 방법
① 당신의 전문성을 주변에 최대한 어필하라.
② 인스타그램 등 SNS 프로필에 자신의 이력과 전문성을 어필하는 글을 올려라.
③ 자신의 블로그 또는 홈페이지를 만들고 전문적인 글을 주기적으로 올려라.
④ 자신을 전문가로 소개하는 명함을 만들고 만나는 사람마다 주어라.
⑤ 크몽, 오투잡 등 각종 프리랜서 플랫폼에 이력을 올리고 홍보하라.
⑥ 일거리를 받으면 높은 품질로 완성하고 고객에게 추천 및 평을 써달라고 요청하라.
⑦ 고객에게 받은 추천, 평가들을 소중히 간직하며 마케팅, 홍보용으로 사용하라. - P65
자바 프로그래밍 기본, HTML5/CSS3, 자바스크립트, 스프링 - P72
사실 빅데이터 분석에는 RDB보다는 No-SQL을 많이 쓰고 R보다는 파이썬을 더 많이 쓰는데 - P73
AI 빅데이터 부분은 다양한 실전 데이터로 직접 다루어봐야 하는데 예제에 나오는 ‘예제 데이터toy set‘로는 절대 실력이 늘지 않는다. 예쁘게 정제되어 있는 ‘예제 데이터‘를 가지고 예제에 다 나와 있는 기본 코드를 복사해 붙여넣기 하는 것을 누가 못하는가? 실제 데이터를 DB 또는 크롤링 등으로 직접 수집한 후 가공, 정제를 거쳐 목적에 맞는 결과를 얻기 위한 모델을 직접 생각하고 고안해서 적용해야 한다. 다 만들어져 있는 데이터에 예제에서 쓰라고 주는 코드를 복사해 붙여넣기 해서는 실전에서 데이터 분석을 못한다. - P73
프론트엔드 개발할 때 쓰이는 MVC 패턴 - P74
개인적으로 MVC 패턴은 내가 과거에 아무리 이해하려고 해도 이해가 어려웠던 부분이다. 그러나 나는 MVC를 몰라도 AI 빅데이터 전문가로 버젓이 활동하고 있다. - P74
UI 설계, 애플리케이션 빌드, 배포 - P75
패스트캠퍼스, DS스쿨, 인사이트 캠퍼스, 탈잉 등 오프라인, 온라인을 이용해 IT 실무를 가르치는 학원, 플랫폼들이 너무나도 많다. - P75
AI 빅데이터 전문가가 되기 위해서는 수리통계학적 지식, 코딩 능력, 경영학적 서술 능력을 두루 겸비해야한다. 그래서 가장 섹시한 학문이고 전문적인 분야이기도 하다. - P77
왜 수리통계학적 지식이 중요할까? 실제 실전에서 데이터 분석을 하게 되면 목적에 부합하는 모델을 직접 선택하고 적용해야 한다. 학원에서는 어떤 모델을 쓰라고 직접 알려주지만 실전에서는 알려주는 선생님이 없다. 자신이 해당 데이터와 분석 목적에 가장 부합하는 모델을 선택해야 하는데 이때 수학적·통계학적 지식이 있어야 어떤 모델을 선택할지 알 수 있다. 때에 따라서는 모델을 조금 변형하거나 여러 모델을 결합해 분석할 때도 많은데 수학적·통계학적 지식이 전혀 없으면 이러한 작업이 이루어질 수 없다. - P77
데이터 전처리 작업 코딩은 직접 다양한 데이터를 다루어보면서 익혀야 한다. 소량의 정형화된 예제 데이터로는 이러한 전처리 작업 코딩을 전혀 해볼 수가 없다. 따라서 실전에서 주어지는 데이터를 보면 당황하게 되고 어디서부터 손을 대야 할지 모른다. 학원에서 알려준 코드를 복사해 붙여넣기 해도 계속 에러가 날 것이다. 당연하다. 데이터 자체 포맷이 학원에서 주는 예제 데이터 세트와는 완전히 다르기 때문이다. 모델 적용도 라이브러리에 있는 모델을 불러와서 함수 하나 호출하면 바로 실행되는 모델 정도만 수업 시간에 한다. - P78
데이터나 분석 목적에 맞는 모델 파라미터 조정 또는 딥러닝 신경망 구조 변경 등은 엄두도 낼 수 없다. 수학적·통계학적 지식이 전혀 없기 때문에 어디를 어떻게 조정해야 할지 모르기 때문이다. - P78
자격증이 전문가를 만드는 것은 아니다 - P79
한국데이터산업진흥원에서 시행하는 데이터 자격시험이 있다. 데이터 분석 자격검정, SQL 자격검정, 데이터 아키텍처 자격검정이 있는데 그중에서 그나마 데이터 분석 자격검정이 AI 빅데이터 분석과 관련이 있다. 또한 <한국경제>에서 시행하는 경영 빅데이터 분석사 자격증과 한국산업인력공단에서 시행하는 사회조사분석사가 있다. - P80
데이터 분석 자격검정은 전문가(ADP)와 준전문가(ADSP)로 나뉜다. 개인적으로 이 자격증이 현존하는 자격증 중에서는 그나마 가장 낫다고 생각한다. 난이도도 다른 시험에 비해서는 가장 높은 편이다. 그래도 사실 고시급 자격증과 비교해서는 매우 쉬운 편이다. - P80
문제점도 꽤 있다. 우선 깊이가 너무 없다. 방대한 양을 다루려다 보니 개론적인 설명 위주로 조금씩 언급하고 끝날 뿐이다. 특히 각 알고리즘에 대한 설명은 거의 전무하다. 수학적인 설명은 없고 개론적인 설명 몇 줄 후 예시 코드를 보여주는 게 전부다. 데이터 수집, 데이터 전처리에 대한 설명도 없다. 코드도 R 코드밖에 없다. 최근 AI 빅데이터 시대에 특히 딥러닝 같은 경우는 거의 파이썬을 사용한다. 파이썬 없이 R 코드만 있는 것도 큰 문제다. 그래도 비전공자가 AI 빅데이터 관련해서 한번 공부해보기에는 좋은 시험인 것 같다. 전공자도 복습 겸 공부하는 것도 괜찮다. 하지만 절대 전문가로 인정받을 만한 시험은 아니다. - P81
SQL 자격검정(SQLP. SQLD)은 데이터베이스에 대한 이해를 묻는 시험이다. 주로 SQL 쿼리에 대한 문제가 많이 출제된다. 하지만 AI빅데이터 분석에서 데이터를 가져오는 쿼리 부분은 사실 극도로 작은 부분일 뿐이다. 더욱이 최근에는 No-SQL이 대세인데 이 시험은 아직까지 RDB를 활용한 오라클, MS SQL을 이용해서 시험을 출제한다. 자격증을 취득하기 위해서 공부하는 시간에 비해 얻어가는 것은 부족하다. 그래도 전통적인 RDB에 대해서 관심이 있는 사람은 공부해볼 만하다. - P81
데이터 아키텍처 자격검정(DAP, DASP)이 있다. 나도 이 시험은 공부만 조금 하고 시험도 보지 않았다. 이 자격증은 심지어 국가공인자격증으로 인정해주지도 않는다. 데이터 아키텍처를 설계하는 방법에 관한 것인데 쓸모가 없다. 더군다나 이 시험도 RDB를 기준으로 시험 문제를 출제한다. 그리고 시험 내용의 절반이 실무와 관련 없는 너무 이론적인 것을 출제해서 시험을 본 뒤에 다 잊어버려도 되는 내용이 태반이다. - P81
이 시험(<한국경제>에서 시행하는 경영 빅데이터 분석사 자격증)은 한국데이터산업진흥원의 데이터 분석 자격검정과 유사하다. 하지만 국가공인 시험이 아닌 데다가 데이터분석 자격검정보다 더 얕은 수준의 개론에만 머물러 실제 실무에는 큰 도움이 안 된다. 그리고 이 시험도 역시 R코드만 출제되고 파이썬은 없다. 초보자들도 한번 쭉 훑어보고 2주 정도 공부하면 충분히 딸 수 있는 자격증이다. - P82
한국산업인력공단에서 시행하는 사회조사분석사는 전통적으로 꽤 인기 있는 시험 중 하나다. 특히 통계학과 학생들에게 인기가 있다. 이 자격증은 AI 빅데이터와는 직접적으로 관련이 없지만 통계학적 내용을 묻는 문제가 출제되어 공부해두면 나중에 AI빅데이터 알고리즘을 공부할 때 꽤 많은 도움이 된다. 하지만 주의해야 할 점은 필기시험은 어느 정도 효용성이 있지만 실기는 전혀 도움이 안 된다는 것이다. 실기시험은 SPSS 툴을 활용해서 AI빅데이터 분석과는 전혀 관련이 없다. 필기시험에서도 절반 이상은 설문조사에 관한 내용이어서 사실 AI 빅데이터와는 관련이 없다. 하지만 뒷부분에 나오는 확률, 통계적 추정, 통계 분석 부분은 AI 빅데이터 관련 알고리즘의 완전 기초가 되는 부분이라 한번쯤 공부하면 좋을 듯하다. - P82
위에서 말한 자격증을 열심히 공부해서 따도 실제 AI 빅데이터 업무에 들어가면 전혀 도움이 되지 못하는 가장 큰 이유는 역시 알고리즘에 대한 깊은 이해와 데이터를 다룰 수 있는 코딩 능력을 자격증이 채워주지 못한다는 데 있다. - P83
기본 알고리즘에 대한 개론적인 설명만 듣고는 예제 데이터 정도의 데이터만 다룰 수 있다. 가장 대표적인 예제 데이터로는 iris(꽃) 데이터 세트가 있는데 150×5 차원의 아주 소량의 데이터다. 빅데이터라 말할 수도 없는 양이다. 그냥 사람이 눈으로 봐도 될 정도의 양이다. - P83
실전에서는 예제 데이터처럼 예쁘게 데이터가 주어지지 않는다. 텍스트, 오디오, 이미지와 같은 비정형 데이터가 즐비하고 중간중간에 결측치 데이터, 시간이 안 맞는 데이터, 오류 또는 이상치 데이터들이 즐비하다. 이러한 데이터들을 규격화하고 정규화하고 예쁘게 만들어야 모델에 적용할 수 있다. - P83
데이터 수집 자체도 웹에서 크롤링을 할 수도 있고 몽고DB, 엘라스틱 서치와 같은 비교적 최근에 나온 DB를 이용해야 할 수도 있다. 아파치 하둡, 스파크를 이용해서 데이터를 조회, 처리해야 하는 경우도 있다. 위에서 말한 자격증에서 조금 배운 R 코드로는 아무것도 할 수가 없다. 또한 주어진 데이터로 어떤 알고리즘을 적용해야 할지도 막막하다. - P84
온라인과 SNS 플랫폼의 발달로 이미지, 동영상, 텍스트와 같은 비정형 데이터가 엄청나게 많이 쌓이고 있다. 이러한 비정형 데이터들은 말 그대로 정형화되어 있지 않은 데이터다. 즉, 규격화되어 있지 않은 제멋대로인 데이터인 것이다. 따라서 전문가가 일일이 전처리 과정 또는 규격화 과정을 거쳐야 한다. - P84
사물인터넷의 발달도 데이터 전처리 작업에 더 큰 부하가 걸리게 할 것이다. 사물인터넷 센서에서 실시간으로 나오는 데이터들은 기기의 오작동으로 생긴 결측치 데이터, 이상 데이터, 시간 규격이 맞지 않는 데이터 등의 수많은 문제가 발생할 수 있다. 또한 같은 기계라도 날씨와 고도에 따라 센서 값이 조금씩 다를수도 있다. 이런 것을 다 반영해 규격화하고 정규화하는 과정이 필요하다. - P84
|