Please enable JavaScript.
Coggle requires JavaScript to display documents.
2.인공지능과 학습 (1304 김동준 ) - Coggle Diagram
2.인공지능과 학습 (1304 김동준 )
데이터 전처리와 핵심 속성 추출
-
-
핵심 속성 추출하기
데이터는 관찰이나 실험을 통해 수집되는 값들을 의미하며, 하나의 데이터는 여러 개의 속성(attribute)으로 구성되어 있다. 데이터 속성이란 데이터를 설명하는 특징 이나 성질을 말한다.
다음 그림에서 학생 데이터는 나이, 성별, 출생지. 내신 성적, 학업 태도 총 5개의 속성으로 이루어져 있다. 속성값은 각 속성이 가질 수 있는 값으로 숫자나 텍스트 등 으로 나타낸다. 예를 들어 학생 데이터에서 나이의 속성값은 17, 19 등이 될 수 있으 며, 성별의 속성값은 남성 또는 여성이 될 수 있다.
데이터의 모든 속성은 기계학습에 어떤 영향을 미치는지 확인해야 한다. 문제 해 결에 필요한 속성만 선택하여 사용해야 기계학습의 성능을 높일 수 있다. 이때 문제 해결에 필요한 속성을 핵심 속성이라고 한다. 만약 핵심 속성이 부족하다면, 추가 자 료를 수집해야 한다.
예를 들어 학생 데이터의 성적에 따라 대학 합격 여부를 예측하고자 할 때, 예측 성능을 높이기 위해서는 어떤 속성이 필요할까? 대체로 내신 성적과 학업 태도는 대 학 합격 여부를 예측하는 데 필요한 속성으로 이를 핵심 속성이라고 볼 수 있다. 단, 해결하고자 하는 문제와 상황에 따라 필요한 속성은 달라질 수 있
데이터의 속성 중에서 기계학습에 필요한 핵심 속성을 찾는 과정이 필요하다. 이 때 데이터를 시각화하면 어떤 속성이 문제 해결에 필요한지 직관적으로 판단할 수 있으며, 속성 간의 관계를 쉽게 파악할 수 있다. 시각화할 때 사용하는 도구에는 막 대그래프, 히스토그램, 원그래프, 산점도, 히트맵 등이 있으며, 특히 핵심 속성을 추
-
-
속성 간의 상관관계를 분석한 후 그 값을 히트맵으로 나타내면 해결하고자 하는 문 제와 관련 깊은 핵심 속성들을 상관계수(T)로 찾아내기가 쉬워진다. 세계 행복 보고 서 데이터에서 행복한 나라의 조건을 예측하기 위해, 필요한 핵심 속성을 히트맵으 로 시각화하여 찾을 수 있다.
딥러닝의 이해와 활용
-
인간의 뇌는 약 1,000억 개의 뉴런(neuron)으로 이루어진 거대한 생물학적 네트 워크로서. 뉴런은 다른 뉴런으로부터 신호를 받아 또 다른 뉴런에 전달한다. '이러한 어에서 인공신경망 연구가 시작되었다.
뉴런의 전달 방식을 모방하면, 인간의 지능을 구현할 수 있지 않을까?"라는 아이디
-
-
-
-
-
-
컴퓨터로 처리할 수 있도록 구현한 것이다. 퍼셉트론(perceptron)은 이러한 인공신 하는 변수로, 입력에 대한 가 치를 의미한다.
경망을 실제로 구현한 연산 장치로서, 여러 개의 입력값을 처리하여 하나의 결괏값 인 0 또는 1을 출력하는 인공신경망의 가장 작은 단위이다. 특히, 입력층 1개와 출 력층 1개로 이루어진 구조를 단층 퍼셉트론이라고 한다.
퍼셉트론은 뉴런의 수상 돌기와 같이 데이터를 입력받고, 신경 세포체처럼 입력 받은 데이터를 처리하여 마지막 축삭 돌기에서 다른 뉴런으로 전기 신호를 보내듯 이 데이터를 출력한다. 퍼셉트론은 노드 또는 인공 뉴런이라고도 부른다.
측정값 또는 추정량의 분포 중 심(평균값)과 참값과의 편차를 나타내는 것으로, 활성화 함수 를 거쳐 출력되는 값을 조정하 는 변수를 말한다.
-
출력할 값을 조정해 주는 함 수로 계단 함수, 시그모이드 (sigmoid) 함수, 렐루(ReLU)
-
-
-
-
-
은닉층의 개수를 늘려 층을 깊게 설계할수록 더 복잡한 문제를 해결할 수 있지만, 층 이 깊을수록 계산량이 많아져 학습 시간이 오래 걸리고, 과대적합(overfitting)
-
-
딥러닝은 입력받은 데이터를 학습하기 위해 어떠한 원리로 동작할까? 딥러닝에서
"학습한다'라는 것은 가중치와 편향을 찾아가는 과정을 의미하며, 학습의 최종 목표 는 최적의 가중치와 편향을 찾는 것이다.
뉴런에서 다른 뉴런으로 전달되는 신호의 세기는 정보의 중요도에 따라 달라지는데, 이 때 중요한 정보는 높은 가중치를 곱하여 전달 하고, 반대의 경우는 낮은 가중치를 곱하여 소멸시킨다. 그리고 원하는 결과가 잘 나오도 록 편향을 더하여 약간의 조정을 한다. 여기 서 최적의 가중치와 편향이란 손실함수의 최 솟값으로 기울기가 0인 지점을 의미한다.
-
딥러닝은 많은 계산량과 대량의 데이터가 필요하지만 데이터 처리 기술의 발전과 컴퓨터 하드웨어의 발달로 인해 다양한 학문 분야 및 응용 분야에서 활용되는 사례 가늘고 있다. 특히 비정형 데이터를 다룰 때 좋은 성능을 내고 있으며, 기존의 기계 학습 알고리즘으로 다루기 어려웠던 분야에서 사용되면서 빠르게 발전하고 있다.
-
Neural Network)을 이용한 컴퓨터 비전(computer vision), 순환 신경망(ENN: Be-current Neural Network)을 이용한 음성 인식 및 자연어 처리 등이 있다. 또한 의료, 금융, 쇼핑, 농업 등의 분야는 물론 작곡, 그림 그리기, 소설 쓰기 등 창작 분야에서도 딥러닝이 다양하게 활용되면서 현재의 인공지능 기술에는 딥러닝 알고리즘을 포함하 는 경우가 많다.
컴퓨터 비전
컴퓨터 비전은 사람이 눈으로 사물을 보고 인식하는 것처럼 컴퓨터의 활용을 통해 정지 영상이나 동영상을 분석하여 의미 있는 정보를 추출하는 기술이다. 컴퓨터 비 전은 의료, 금융, 쇼핑 등의 다양한 산업에서 활용되는 것은 물론, 자율주행 자동차 를 구현하는 핵심 기술 중 하나다. 컴퓨터 비전 분야의 대표적인 딥러닝 알고리즘으 로는 합성곱 신경망(CNN: Convolutional Neural Network)이 있다. 합성곱 신경망 은 동물의 시각 인지 과정을 모방한 인공신경망 모형 중 하나로, 사물의 탐지 등이 미지, 처리에 높은 성능을 보여 준다.
-
음성 인식과 자연어 처리는 사람이 사용하는 언어를 컴퓨터가 처리하기 위한 기술 을 연구하는 분야다. 음성은 인간과 인공지능과의 상호 작용에 있어 가장 보편적이 고 편리한 정보 전달 수단이기 때문에 음성 인식 기술은 매우 중요한 분야로 연구가
-
음성을 텍스트로 변환하는 음성 인식 기술과 변환된 텍스트를 분석하여 그 의미를 파악하는 자연어 처리 기술, 음성 인식을 위한 잡음 제거 및 소리 보정 기술, 음성을 텍스트로 변환하는 기술(SIT: Speech-To-Text) 등이 포함된다. 예를 들어 인공지 능 스피커에게 날씨를 물으면 음성 인식과 자연어 처리 시스템은 다음과 같이 동작 한다.
음성 인식과 자연어 처리 분야에 사용되는 대표적인 딥러닝 알고리즘은 순환 신경 망(ENN)이다. 순환 신경망은 데이터 간의 관계나 순서가 중요한 순차적인 데이터를 입력받아 결과를 도출하는 딜러닝 모델로, 자연어 처리나 시간에 따라 변화하는 시계 열 데이터* 등을 처리하는 데 주로 사용된다.
순환 신경망의 구조는 심층 신경망의 구조와 기본 흐름은 유사하다. 다음 층으로 이어지는 중간 출력을 은닉 상태라고 하는데, 데이터의 중간 결과를 기억할 수 있다.
데이터의 중간 결과를 기억하는 특징 때문에 순환 신경망은 오른쪽 예시처럼 이전 입력값이 고려된 현재의 입력값에 따라 출력값을 결정한다. 따라서 순환 신경망은 문장을 모두 읽고 최종적으로 감정을 도출하는 문제에 상당히 적합한 구조이다.
기계학습과 데이터
-
-
-
데이터 수집하기
-
데이터셋은 주제별로 모은 데이터의 집합을 의미한다. 데이터 분석가들이 분석을 위해 가공한 데이터들을 데이터 포털 등의 사이트에 업로드하면 그것을 내려받아 활 용할 수 있다. 개인이 만들어 공유한 데이터뿐만 아니라 여러 기업이나 공공 기관에 서 제공하는 데이터를 활용할 수도 있다. 기업이나 공공 기관에서는 데이터셋을 파 일 또는 AP(Application Programming Interface)* 형태로 만들어 공공 데이터로 제공하기도 한다. 이렇듯 제공된 데이터를 활용할 때, 원 저작권을 침해하지 않도록 유의해야 한다.
데이터 포털 등 인터넷에서 원하는 내용을 수집하기 어렵다면, 직접 데이터를 수 집할 수도 있다. 인터넷 검색 및 웹크롤링(web crawling)*, , 설문 조사, 인터뷰 결과
정리 등 다양한 방식을 통해 데이터를 정리할 수 있으며, 피지컬 컴퓨팅 도구와 컴퓨 팅 시스템, 웨어러블 기기 등을 이용해 여러 센서를 통해 값을 수집할 수도 있다.
-
-
기계 학습 유형과 알고리즘
데이터의 속성 중에서 기계학습에 필요한 핵심 속성을 찾는 과정이 필요하다. 이 때 데이터를 시각화하면 어떤 속성이 문제 해결에 필요한지 직관적으로 판단할 수 있으며, 속성 간의 관계를 쉽게 파악할 수 있다. 시각화할 때 사용하는 도구에는 막 대그래프, 히스토그램, 원그래프, 산점도, 히트맵 등이 있으며, 특히 핵심 속성을 추
-
-
속성 간의 상관관계를 분석한 후 그 값을 히트맵으로 나타내면 해결하고자 하는 문 제와 관련 깊은 핵심 속성들을 상관계수(T)로 찾아내기가 쉬워진다. 세계 행복 보고 서 데이터에서 행복한 나라의 조건을 예측하기 위해, 필요한 핵심 속성을 히트맵으 로 시각화하여 찾을 수 있다.
비지도학습은 정답 데이터 없이 입력 데이터만으로 이루어진 훈련 데이터를 사용 하여 모델을 학습시키는 방법이다. 데이터를 입력하면 컴퓨터는 자체적인 방식으로 데이터를 유사한 속성값을 갖는 그룹으로 묶는다. 정답 데이터가 주어지지 않기 때문 에 컴퓨터는 입력 데이터의 특징을 분석하여 패턴이나 특정 규칙을 찾아내야 한다.
강화학습은 판단할 때마다 외부 환경에서 보상을 제공하고, 이 보상의 값을 최대 화하기 위한 방향으로 학습을 진행한다. 사람이 상을 받으면 특정 행동을 더 늘리고 벌을 받으면 특정 행동을 줄이는 것과 같이, 현재 상태에서 선택 가능한 행동들 중 보상이 가장 큰 경우를 선택하여 해당 방향으로 학습을 진행한다. 강화학습은 사전 에 환경에 대한 명확한 정답이 없는 상황에서 학습하고 적응하는 과정을 따르기 때 문에 지능 에이전트의 학습 과정에 유용하게 활용된다. 또한 소비 패턴 분석을 통한 마케팅 전략 수립 등의 최적화 문제에 주로 활용되고 있다.
지도학습은 입력 데이터와 정답 데이터를 함께 사용하여 기계학습 모델을 하습시 키는 방법이다. 입력 데이터와 그 정답에 해당하는 속성도 함께 제공되므로 학습 길 과에서의 오류 여부와 성능을 쉽고 명확하게 평가할 수 있다.
지도학습에서는 '훈련 데이터(training data)'와 테스트 데이터(test dera)를 사용 한다. 훈련 데이터는 학습 모델을 만들기 위해 사용되며, 테스트 데이터는 모델의 성 능을 평가하기 위해 사용된다.
회귀
회귀는 어떤 현상에 영향을 미칠 수 있는 여러 요인과 특정 결과 사이의 관 계를 함수로 표현해 연속적인 수치를 예측하는 기계학습 방법이다. 즉, 훈련 데이터로 학습한 모델을 사용하여 새로운 입력값에 대한 수치 결과를 예측하 는 것이다. 예를 들어 최근 며칠간 최고 기온 값을 바탕으로 편의점의 아이스 크림 판매량을 예측한다면, 이는 회귀를 활용하여 문제를 해결하는 것이다.
회귀 모델은 훈련 데이터를 기반으로 독립 변수*와 종속 변수 사이의 규칙 을 파악하여 수식으로 나타내고, 학습된 규칙에 새로운 입력값을 대입하여 예 측값을 얻어내는 모델이다. 독립 변수는 주로 입력값을 의미하며, 종속 변수 는 주로 결괏값을 의미한다.
-
-
선형 회귀 알고리즘은 예측값과 실젯값의 오차를 최소화하는 가설 함수를 찾고 최적화하며 학습을 진행한다. 최고 기온이라는 독립 변수를 x축으로, 판매량이라는 종속 변수를 y축으로 하는 그래프를 그렸을 때 데이터를 표현하는 좌표평면 위의 점 들을 가장 알맞게 이어주는 추세선을 그린다. 이때 직선은 y=Wxtb의 형태로 표현 할 수 있는데, 이 식을 가설 함수라고 하며, 이를 가장 정확히 나타내는 값과 b값 을 찾아 수식을 만드는 것이 선형 회귀 알고리즘의 학습 과정이다. 예측값과 실젯값 의 오차를 구하는 손실함수를 이용해 오차를 최소화하면서 예측의 정확도를 높일 수
분류는 미리 정의된 여러 범주로 데이터를 구분하기 위한 경계를 학습하여 새로운 입력이 들어오면 여러 범주 중 하나를 선택하는 과정으로, 지도학습의 한 형태다. 즉 데이터가 어떤 클래스(clas)에 속하는지를 찾는 것이다. 예를 들어 개와 고양이 이 미지를 수집하여 분류 모델을 생성한 후, 테스트 데이터를 입력하면 각 데이터에 대 한 클래스를 개 또는 고양이로 분류할 수 있다.
분류를 이용한 기계학습은 주로 이진 분류와 다중 분류로 나뉜다. 이진 분류는 주 어진 데이터를 2개의 클래스로 분류하는 것이고, 다중 분류는 주어진 데이터를 3개 이상의 클래스로 분류하는 것이다. 예를 들어 환자의 의료 데이터를 수집하여 당뇨 발병 환자와 미발병 환자의 공통적인 특성을 학습하여 새로운 환자가 당뇨 환자인지 아닌지를 판단하는 모델을 만드는 것은 이진 분류의 한 예다.
-
-
-
-
-
-
-
A가 1개, B가 3개이므로 B로 분류하게 된다. 이처럼 k-최근접 이웃은 K값에 따라
-
군집은 비지도학습 알고리즘의 일종으로, 데이터가 어떻게 그룹화되어야 하는지
-
문점은 학습 데이터가 정답 데이터를 가지고 있지 않은 경우이므로 입력된 데이터 의 특성을 분석하여 서로 유사한 특성을 가진 데이터끼리 그룹화한다. 즉, 데이터의 비슷한 특성을 파악하고 이에 따라 데이터를 그룹으로 묶는 것이라고 할 수 있다.
이러한 군집 분석은 대표적으로 고객의 성향을 분석해 비슷한 유형끼리 군집을 만 들어 군집별 상품 추천 알고리즘에 반영할 때 활용된다. 이뿐만 아니라 인구 밀집도 을 분석해 버스 노선을 결정하거나, SNS 조회 기록을 이용해 비슷한 성향의 게시물 을 추천할 때에도 사용한다. 이 외에 데이터 시각화 및 지도학습을 위한 데이터의 전 처리 기술로도 사용된다.
군집 모델을 만들 때 사용하는 대표적인 군집 알고리즘에는 k-평균(k-means) 알고리즘이 있다. 이 알고리즘은 임의의 군집 중심으로부터 가까운 거리에 있는 데 이터를 같은 군집으로 할당하고, 군집의 중심을 변경되지 않을 때까지 계속 바꾸며 조정하는 방식으로 군집을 형성한다.
-
기계학습을 활용한 문재 해결
인공지능을 활용하여 문제를 해결하기 위해서는 해결하고자 하는 문제를 명확하 게 정의하고, 그에 맞는 데이터를 선정하고 수집해야 한다. 또한 그에 적합한 기계학 습 유형과 알고리즘을 선정해 학습에 활용해야 한다
-
-