한국학술지인용색인(Korea citation index, KCI): 한국연구재단의 학술지 평가를 통해 논문을 등재하거나 등재 후보를 선정하는 국내학술지 정보가 모인 전문 정보 서비스다. 게재논문에 대한 각종 정보를 제공한다. - P341
케라스(Keras): 파이썬으로 작성된 오픈 소스 신경망 라이브러리다. 사용자의 부담을 덜기 위해 일관되고 간결한 API를 제공한다. - P341
K-겹 교차검증(K-fold cross validation): 모든 데이터를 최소 한 번 테스트 데이터셋으로 사용하도록, K겹으로 데이터를 나눈 후 매번 테스트 데이터셋을 바꾸어 나가는 방법. - P341
장단기 메모리(Long short-term memory, LSTM): 딥러닝 분야에서 사용되는 순환 신경망 기반의 신경망 모델이다. 셀, 입력 게이트, 출력 게이트, 망각 게이트로 구성되어 셀은 임의의 시간 간격에 대한 값을 기억하고 세 가지 게이트는 셀 안팎으로의 정보 흐름을 조절한다. - P342
무크(MOOC): 웹 서비스를 기반으로 이루어지는 상호참여적이고 대규모의 교육 시스템이다. - P342
주성분 분석(Principal component analysis. PCA): 고차원의 데이터를 저차원의 데이터로 축소시키는 기법을 의미한다. 이때 서로 연관성이 있는 고차원 공간의 표본들을 선형 연관성이 없는 저차원 공간(주성분)의 표본으로 변환하기 위해 직교 변환을 사용한다. - P342
파이썬(Python); 1991년 귀도 반 로섬이 발표한 고급 프로그래밍 언어다. 운영체제나 플랫폼에 독립적이며 인터프리터, 객체 지향, 동적 입력이 가능하다는 특징이 있다. - P342
파이토치(Pytorch): 오픈소스 머신러닝 라이브러리다. 1993년에 루아(lua)라는 프로그래밍 언어로 개발된 오픈 소스 머신러닝 라이브러리인 토치(Torch)를 파이썬에 구현한 것이다. 자연어 처리와 관련된 모델이나 응용 프로그램을 개발할 때 주로 사용한다. - P342
R: 통계 계산과 그 결과를 그래픽으로 나타내기 위한 프로그래밍 언어이자 소프트웨어환경이다. 무료로 사용할 수 있는 오픈 소스로 공개되어 있다. - P342
랜덤 포레스트(Random Forest): 분류나 회귀분석 등에 사용되는 앙상블 학습 방법의 하나다. 학습 과정에서 구성한 결정 트리 여러 개에서 분류 또는 평균 예측값(회귀분석)을 출력한다. - P342
지역적 합성곱 신경망(Regions with CNN. R-CNN): 사람이 설정한 지역을 합성곱 신경망의 특징(feature, 입력값)으로 활용하여 객체 인식(Object Detection)을 수행한다. - P342
순환 신경망(Recurrent neural network, RNN): 입력과 출력을 특정 순서(Sequence) 단위로 처리하는 인공 신경망 모델이다. - P342
과학인용색인 확장판(Science Citation Index Expanded. SCIE): 과학 저널들 중 엄격한 심사를 거쳐 선별한 학회지의 목록 - P342
스코퍼스(Scopus): 2004년 네덜란드의 엘스비어 출판사가 만든 전 세계 우수 학술 논문데이터베이스 플랫폼이다. - P342
Seq2seq: 언어 처리에 사용되는 머신러닝 기반 방법론이다. 언어 번역, 이미지 캡션, 대화 모델, 텍스트 요약에 주로 사용한다. - P343
자기조직화지도(Self-organizing map, SOM): 사람이 눈으로 볼 수 있는 저차원(2차원 내지 3차원) 좌표에 고차원 데이터의 개체 각각이 대응하도록 인공 신경망과 유사한 방식의 학습을 통해 군집화하는 기법이다. - P343
SPSS - 통계 분석과 데이터 마이닝 등에 사용되는 통계 분석 프로그램이다. - P343
텐서플로(Tensorflow): 다양한 작업의 데이터 흐름을 제어하는 프로그래밍에 사용하는 오픈 소스 소프트웨어 라이브러리다. 수학 라이브러리이자 인공 신경망 같은 머신러닝 애플리케이션에서 사용한다. - P343
단어 빈도와 역문서 빈도(Term frequency-inverse document frequency, TF-IDF): 정보 검색과 텍스트 마이닝에서 이용하는 가중치를 의미한다. 여러 가지 문서로 이루어진 문서 그룹이 있을 때 어떤 단어가 특정 문서 안에서 얼마나 중요한 것인지를 나타내는 통곗값을 계산한다. - P343
토이셋(Toyset): 데이터를 분석할 때 쉽고 빠르게 결과를 볼 수 있도록 만들어진 예제 데이터셋이다. - P343
검정 데이터셋(Validation set): 학습이 완료된 모델을 검증하기 위한 데이터셋이다. 하이퍼파라미터를 튜닝할 때 꼭 필요하다. - P343
Word2Vec: 신경망 모델을 사용하여 대규모 텍스트 말뭉치(corpus)서 단어 연관성을 학습한다. - P343
YOLO(You only look once): 이미지 전체에 대해서 신경망 하나(a single neural network)가 한번의 계산만으로 바운딩 박스(bounding box)와 클래스 확률(class probability)을 예측한다. R-CNN에 비해서 비약적으로 빠른 속도를 자랑한다. - P343
가설(hypothesis): 현실적 조건에서는 증명하거나 검증하기 어려운 사물, 현상의 원인 또는 합법칙성에 관하여 예측하는 이론. - P343
감성 분석(Sentiment analysis): 자연어 처리, 텍스트 분석, 전산 언어학 및 생체 인식을 사용하여 정서 상태 및 주관적인 정보를 체계적으로 식별, 추출, 정량화하는 기술이다. - P343
결측값(Missing value): 데이터셋에서 누락된 값이다. - P343
경사하강법 (Gradient descent): 함수의 기울기를 구한 후 기울기의 절댓값을 낮은 쪽으로 계속 이동시켜 극값에 이를 때까지 반복하는 최적화 알고리즘이다. - P344
과적합(Overfitting): 학습 데이터에 대해서는 오차가 작지만 실제 데이터에 대해서는 오차가 크도록 과하게 학습된 상태 - P344
네트워크 분석(Network analysis): 노드(node)와 엣지(edge)로 이뤄진 자료구조를 통해 노드사이의 연관관계를 분석하는 것이다. - P344
뉴런(Neuron): 인공 신경망의 모델을 학습할 때 계산을 수행하는 개체다. 수많은 뉴런이 연결되어 병렬 연산을 수행한다. - P344
드롭아웃(Dropout): 학습 데이터를 대상으로 복잡하게 학습하는 작업을 막아 인공 신경망의 과적합을 줄이는 정규화 기술이다. 일부 뉴런을 인위적으로 제거하여 신경망을 간소화한다. - P344
배치 정규화(Batch normalization): 학습할 때 사용하는 미니배치 단위를 정규화하여 학습속도를 개선하고 과적합 문제를 해결하는 것이다. - P344
불용어(Stopword): 큰 의미가 없는 단어 토큰을 의미한다. - P344
시각화(Visualization): 데이터 분석 결과를 쉽게 이해할 수 있도록 시각적으로 표현하고 전달되는 과정을 의미한다. - P344
시계열(Time series): 일정 시간 간격으로 배치된 데이터들의 수열이다. - P344
임베딩(Embedding): 자연어 처리에서 특징 추출을 통해 수치화하는 방법이다. - P344
재현율(Recall): 실제 참(True)인 것 중에서 모델이 참(True)이라고 예측한 비율을 뜻한다. - P344
전처리(Preprocessing): 분석하기 좋게 데이터를 고치는 모든 작업을 의미한다. - P344
정밀도(Precision): 모델이 참(True)이라고 예측한 것 중에서 실제 참(True)인 것의 비율을 뜻한다. - P344
클라우드 서버(Cloud server): 물리적 서버 하나를 나누어 여러 개의 가상 서버로 사용하는 가상화 방법의 한 형태다. - P344
토픽 모델링(Topic modeling): 단어 각각이나 문서 집합에 대해 숨겨진 주제를 찾아내어 문서나 키워드별 주제끼리 묶어주는 비지도 학습 알고리즘이다. - P344
파라미터(Prameter): 수학과 통계학에서 어떠한 시스템이나 함수의 특정한 성질을 나타내는 변수를 뜻한다. - P345
활성화 함수(Activation function): 입력 또는 입력 데이터셋이 주어졌을 때 해당 노드의 출력을 정의하는 함수다. - P345
|