Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습 (김경문 1104) - Coggle Diagram
인공지능과 학습 (김경문 1104)
기계학습의 유형과 알고리즘
기계학습 유형
기계학습은 데이터를 활용하는 방식에 따라 지도학습, 비지도학습, 강화학습으로 구분을 할 수 있다. 데이터를 이용하여 학습할 떄 사전에 정답이 있는 데이터를 활용하여 학습하는 것을 지도 학습이라고 하며, 정답을 알려주지 않고 데이터만을 제시하여 학습하는 방법을 비지도학습이라고 한다.
지도학습
지도학습은 입력 데이터와 정답 데이터를 함께 사용하여 기게학습 모델을 학습 시키는 방법이다. 입력 데이터와 그 정답에 해당하는 속성도 함께 제공되므로 학습 결과에서의 오류와 성능을 쉽고 명확학 평가 할 수 있다. 그리고 지도학습에서는 훈련 데이터와 테스트 데이터를 사용한다.
-
-
비지도학습
비지도학습은 정답 데이터 없이 입력 데이터만으로 이루어진 훈련 데이터를 사용하여 모델을 학습시키는 방법이다. 데이터를 입력하면 컴퓨터는 자체적인 방식으로 데이터를 유사한 속성값을 갖는 그룹으로 묶는다.
강화학습
강화학습은 판단할 떄마다 외부 환경에서 보상을 제공하고, 이 보상의 값을 최대화하기 위한 방향으로 학습을 진행한다. 사람이 상을 받으면 특정 행동을 더 늘리고 벌을 받으면 특정 행동을 줄이는 것과 같이, 현재 상태에서 선택 가능한 행동을 중 보상이 가장 큰 경우를 선택하여 해당 방향으로 진행한다.
회귀(예측)
회귀는 어떤 현상에 영향을 미칠 수 있는 여러 요인과 특정 결과 사이의 관계를 함수로 표현해연속적인 수치를 예측하는 기계학습 방법이다. 희귀모델은 훈련데이터를 기반으로 독립변수 와 종속변수 사이의 규칙을 파악하여 수식으로 나타내고, 학습된 규칙에 새로운 입력값을 대입하여 예측값을 얻어내는 모델이다.
분류
분류는 미리 정의된 여러 범주로 데이터를 구분하기 위한 경계를 학습하여 새로운 입력이 들어오면 여러 범주 중 하나를 선택하는 과정으로, 지도학습의 한 형태입니다. 데이터가 어떤 클래스에 속하는지를 찾는 것입니다. 기계학습은 주로 이진 분류와 다중 분류로 나눕니다. 이진분류는 주어진 데이터를 2개의 클래스로 분류하는 것이고, 다중 분류는 주어진 데이터를 3개 이상의 클래스로 분류하는 것입니다.
기계학습과 데이터
전통적 프로그래밍과 기계학습
기계학습이 등장하기 전의 전통적 프로그래밍을 이용한 문제 해결 방식은 이러한 자동화 능력을 구현하기 위해 규칙을 프로그래머가 직접 만들고, 규칙을 표현한 알고리즘에 데이터를 입력하면 컴퓨팅 시스템이 알고리즘에 따라 처리한 결과를 출력한다.
-
-
데이터 선정하기
데이터를 이루는 데이터 속성은 기계학습에서 매우 중요한 역할을 한다. 데이터를 선정할 때의 고려 사항은 다음과 같다. 기계학습을 위한 데이터를 선정할 떄에는 우리가 해결하고자 하는 문제와 관련 있는 데이터인지 확인해야 한다.
-
수집 가능성
수집할 방법이 없거나 수집하기 어려운 데이터는 피하고, 수집할 수 있는 데이터를 선정한다.
-
-
-
데이터 수집하기
데이터셋은 주제별로 모은 데이터의 집합을 의미한다. 데이터 분석가들이 분석을 위해 가공한 데이터들은 데이터 포털 등의 사이터에 업로드하면 그것을 내려받아 활용할 수 있다. 개인이 만들어 공유한 데이터뿐만 아니라 여러 기업이나 공공 기관에 일 또는 API 형태로 만들어 공공 데이터로 제공하기도 한다.
데이터 전처리와 핵심 속성 추출
데이터 전처리하기
기계학습에 사용할 데이터를 선정하고 수집한 후에는 데이터 전처리 과정이 필요하다. 데이터 전처리란 결측치와 이상치의 유무를 파악하고 문제 해결에 필요한 속성이 무엇인지 선별한 다음 문제 해결에 적합한 형태로 데이터를 가공하는 과정을 말한다.
결측치 처리하기
결측치란 데이터의 값이 비어 있거나 누락된 상태를 뜻한다, 결측치가 있으묜 데이터를 분석하는 과정에서 에러가 발생하거나 잘못된 결과가 산출되어 기계학습 모델 성능에 부정적인 영향을 미칠 수 있다. 그러므로 결측치가 있는지 확인하고, 이를 적절하게 처리해야 한다.
이상치 처리하기
사람의 키 속성에서 200CM 이상의 값은 존재할 수 있지만, 이는 매우 드문 경우로 이상치로 간주 될 수 있다/ 이처럼 이상치란 평균적인 데이터 범위보다 지나치게 높거나 낮은 수치를 말한다. 이상치가 데이터에 존재하면 분석결과가 왜곡 될 수도 있으므로, 이를 적절하게 처리해야 한다.
히트맵으로 핵심 속성 추출
시각화할 때 사용하는 도구에는 막대그래프, 히스토그램, 원그래프, 산점도, 히트맵 등이 있으며, 특히 핵심 속성을 추출할 때는 히트맵을 주로 사용한다.