Please enable JavaScript.
Coggle requires JavaScript to display documents.
2.인공지능과 학습(1515박혜원) - Coggle Diagram
2.인공지능과 학습(1515박혜원)
딥러닝의 이해와 활용
인공 신경망은 인간의 신경망 구조를 모방하여 컴퓨터로 처리할 수 있도록 구현한 것이다. 퍼셉트론은 이러한 인공신경망을 실제로 구현한 연산 장치로서, 여러개의 입력값을 처리하여 하나의 결괏값인 0또는 1을 출력하는 인공신경망의 가장 작은 단위이다.
딥러닝은 여러 개의 은닉층을 포함하여 만든 심층 신경망을 통해 학습이 이루어지는 기계학습의 한 방법이다. 딥러닝에서는 입력층에서 은닉층을 거쳐 출력층으로 연속적인 연산이 이루어진다.
딥러닝에서 '학습한다' 라는 것은 가중치와 편향을 찾아가는 과정을 의미하며, 학습의 최종목표는 최적의 가중치와 편향을 찾는 것이다.
신호의 세기는 정보의 중요도에 따라 달라지는데, 이때 중요한 정보는 높은 가중치를 곱하여 전달하고, 반대의 경우는 낮은 가중치를 곱하여 소멸시킨다. 편향을 더하여 약간의 조정을 한다.
손실함수란 훈련 데이터를 잘 학습했는지 파악하는 함수로, 예측값과 실제값과의 차이를 구하는 함수다.
최적화란 손실함수의 값이 최소가 되도록 가중치와 편향을 갱신하는 과정을 으미하며, 오차 역전파를 통해 이루어진다. 가장 대표적인 최적화 방법으로는 경사 하강법이 있다.
경사 하강법의 단점을 보완하여 속도가 빠르고 대체로 더 좋은 성능을 보여주는 최적화 알고리즘으로는 확률적 경사 하강법, 미니 배치 경사 하강법, 모멘텀, 아담 등이 있다.
딥러닝의 활동 분야로는 비정형 데이터를 다룰 때 좋은 성능을 내고 있으며, 기존의 기계학습 알고리즘으로 다루기 어려웠던 분야에서 사용되면서 빠르게 발전하고 있다. 실생활 속 딥러니이 활용되는 사례로는 합성곱 신경망을 이용한 컴퓨터 비전, 순환 신경망을 이용한 음성인식 및 자연어 처리 등이 있다.
-
사람이 사용하는 언어를 컴퓨터가 처리하기 위한 기술을 연구하는 분야다. 음성은 인간과 인공지능과의 상호 작용에 있어 가장 보편적이고 편리한 정보 전달 수단이기 때문에 음성인식 기술은 매우 중요한 분야로 연구가 활발히 이루어지고 있다.
순환 신경망은 데이터 간의 관계나 순서가 중요한 순차적인 데이터를 입력받아 결과를 도출하는 딥러닝 모델로, 자연어 처리나 시간에 따라 변화하는 시계열 데이터 등을 처리하는 데 주로 사용된다.
-
딥러닝으로 손글씨 분류하기
렐루
렐루 함수는 입력값 x가 음수이면 0으로 출력하고, x가 양수이면 해당값인 x를 그대로 출력한다.
소프트맥스
소프트맥스 함수는 3개 이상을 분류하는 다중 분류에 사용된다. 예측 확률을 0과 1 사이의 값으로 나타내며, 이때 출력값의 총합은 1로 비율을 파악할 수 있다.
-
adam
경사 하강법에서 여러 번의 발전 과정을 거친 adam은 관성을 이용하여 정확도를 개선하고, 일부 데이터만 사용하여 가증치를 업데이트 함으로써 속도를 빠르게 개선한 최적화 기법 중 하나다.
기계학습과 데이터
전통적 프로그래밍과 기계학습
-
자동화 능력을 구현하기 위해 규칙을 프로그래머가 직접 만들고, 규칙을 표현한 알고리즘에 데이터를 입력하면 컴퓨팅 시스템이 알고리즘에 따라 처리한 결과를 출력한다.
-
기계학습을 통한 문제 해결 과정
-
문제 상태를 정확히 파악하고 정의 할 수 있어야 한다. 현재 상태와 목표 상태가 무엇인지, 활용해야 하는 핵심 요소는 무엇인지 등을 정확히 분석해야 문제 해결 방향을 명확히 설정할 수 있으므로 문제 정의 단계는 매우 중요하다.
기계학습을 통해 해결할 수 있는 문제인지 확인해야 한다. 훈련 데이터 양과 질, 활용하는 프로그램의 성능, 앞으로의 기술 발전 양상에 따라 달라질 수 있으므로 명확히 정의하기는 어렵다.
문제 해결을 위한 데이터
대용량의 품질 좋은 훈련 데이터가 필요하다. 훈련 데이터의 질이 좋지 않거나 질이 좋더라도 데이터의 양이 충분하지 않으면 기계학습 모델의 성능은 높지 않을것이다. 또한 수집한 훈련 데이터가 편향을 띤다면 이 데이터를 이용한 학습 결과도 정확하지 않을것이다.
-
훈련 데이터 양이 너무 적거나 양이 충분하더라도 체형을 분석하기에 적합한 속성이 부족하거나, 한쪽으로 치우친 데이터만 사용한다면 성공적으로 정확한 모델을 생성하기 어렵고, 기계학습으로 해결할 가능성이 낮아진다.
기계학습을 이용해 우리나라의 저출산 문제를 해결한다고 가정해보자. 저출산 문제는 다양한 사회적, 경제적 요인이 복합적으로 작용해 발생했기 때문에 인공지능의 학습에 필요한 우수한 품질의 데이터를 적절히 확보하기 어렵다.
데이터 선정 및 수집하기
-
기계학습을 위한 데이터를 선정할 때에는 우리가 해결하고자 하는 문제와 관련있는 데이터인지 확인해야 한다. 또한 데이터의 수집 가능성, 정보 보호 여주, 데이터의 품질, 데이터 수집 비용 등의 요인을 고려하여 조건에 부합하는 데이터를 선정해야 한다.
데이터셋은 주제별로 모은 데이터의 집합을 이미한다. 개인이 만들어 공유한 데이터 뿐만 아니라 여러 기업이나 공공기관에서 제공하는 데이터를 활용할 수도 있다. 기업이나 공공 기관에서는 데이터셋을 파일 도는 API형태로 만들어 공공 데이터로 제공하기도 한다.
기계학습의 유형과 알고리즘
기계학습은 데이터를 활용하는 방식에 따라 지도학습, 비지도 학습, 강화학습으로 구분할 수 있다.
-
-
-
-