Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습(1518 양윤빈) - Coggle Diagram
기계학습과 데이터
기계학습과 문제 해결
-
기계학습을 통한 문제 해결 과정
-
기계학습을 이용하여 문제를 해결하기 위해서는 문제 상태를 정확히 파악하고 정의할 수 있어야 함. 주어진 상황의 현재 상태와 목표 상태가 무엇인지, 핵심 요소는 무엇인지 정의해야함.
정의한 문제가 기계학습을 통해 해결할 수 있는 문제인지 확인해야 함.이는 훈련 데이터의 양과 질, 활용하는 프로그램의 성능, 앞으로의 기술 발전 양상에 따라 달라짐.
데이터 선정 및 수집하기
데이터 선정하기
데이터 선정 시 고려 사항
-
수집 가능성 : 수집할 방법이 없거나 수집하기 어려운 데이터를 피하고, 수집할수 있는 데이터를 선정
-
-
-
데이터 수집하기
-
데이터셋 : 주제별로 모은 데이터의 집합
데이터 분석가들이 분석을 위해 가공한 데이터들을 데이터 포털 등 사이트에 업로드, 그것을 내려받아 활용 가능. 제공된 데이터 활용 시 원 저작권을 침해하지 안도록 유의해야 함.
데이터 포털 등에서 원하는 내용을 수집하기 어렵다면, 인터넷 검색 및 웹크롤링, 설문조사, 인터뷰 결과 정리 등 다양한 방식을 통해 직접 데이터 정리 가능. 피지컬 컴퓨팅도구와 컴퓨팅 시스템, 웨어러블 기기 등을 이용해 여러 센서를 통해 값 수집 가능.
문제 해결을 위한 데이터
-
데이터 공정성 : 데이터 수집, 처리, 사용, 공유 과정에서의 공평성과 투명성을 의미.
-
데이터 처리 및 분석의 공정성 : 데이터를 처리하고 분석할 때, 분석 방법이나 모델이 편향되거나 불공정한 결과를 도출하면 안 됨
데이터 사용의 공정성 : 데이터는 공정하게 사용되어야 하며, 활용될 때에도 불필요한 차별이나 편견이 존재해서는 안 됨.
-
데이터 편향의 영향력
데이터 편향 : 데이터가 한쪽으로 치우진 성질, 잘못된 학습 결과를 도출해 기계학습의 정확도를 떨어뜨리는 원인
-
데이터 전처리와 핵심 속성 추출
데이터 전처리하기
결측치 처리하기
결측치 : 데이터의 값이 비어 있거나 누락된 상태
결측치가 있으면 데이터 분석 과정에서 에러 발생, 잘못된 결과가 산출되어 기계학습 모델 성능에 부정적 영향.
결측치 처리 방법: 결측치가 있는 행이나 열 삭제/평균, 중앙값, 최빈값 등 대푯값으로 결측치 대체
-
-
핵심 속성 추출하기
핵심 속성 이해하기
데이터의 모든 속성은 기계학습에 어떤 영향을 미치는지 확인해야 함. 문제 해결에 필요한 속성만 선택하여 사용해야 기계학습의 성능 높일 수 있음. 이때 문제 해결에 필요한 속성이 핵심 속성. 핵심 속성이 부족하다면 추가 자료 수집이 필요.
히트맵으로 핵심 속성 추출하기
데이터 속성 중 기계학습에 필요한 핵심 속성을 찾을 때 데이터를 시각화면 직관적으로 판단 가능. 시각화 시 사용하느 도구 : 막대 그래프, 히스토그램, 원그래프, 산점도, 히트맵
히트맵 : 상관관계를 시각화한 그래프, 색을 이용해 배열을 나타냄. 속성 간 상관관계 분석 후 히트맵으로 나타내면 핵심 속성들을 상관계수로 찾아내기 쉬웢ㅁ.
상관관계 분석
-
양수는 양의 상관관계, 음수는 음의 상관관계를 의미.
-
-
-
-
기계학습의 유형과 알고리즘
기계학습의 유형
지도학습
입력 데이터와 정답 데이터를 함께 사용하여 기계학습 모델을 학습시키는 방법. 입력 데이터와 그 정답에 해당하는 속성 함께 제공되므로 학습 결과에서의 오류 여부와 성능을 쉽고 명확하게 평가 가능.
-
-
비지도 학습
정답 데이터 없이 입력 데이터만으로 이루어진 훈련 데이터를 사용하여 모델을 학습시키는 방법. 데이터를 입력하면 컴퓨터는 자체적인 방식으로 데이터를 유사한 속성값을 갖는 그룹으로 묶음. 정답 데이터가 주어지지 않으므로 입력 데이터의 특징을 분석하여 패턴이나 특정 규칙을 컴퓨터가 찾아냄.
강화확습
-
사전에 환경에 대한 명확한 정답 없는 사왕에서 학습하고 적응하는 과정을 따르므로 지능 에이전트의 학습 과정에서 유용하게 활용. 또한 소비 패턴 분석을 통한 마케팅 전략 수립 등의 최적화 문제에 주로 활용
기계학습 알고리즘의 이해
회귀
-
훈련 데이터를 기반으로 독립 변수와 종속 변수사이의 규칙을 파악하여 수식으로 표현, 학습된 규칙에 새로운 입력값을 대입하여 예측값을 얻어냄. 독립 변수는 주로 입력값을 의미, 종속 변수는주로 결괏값을 의미
대표적 알고리즘 : 선형 회귀 알고리즘
데이터를 표현하는 좌표평면 위의점들을 가장 알맞게 이어주는 추세선 그림. 이때 그 직선을 나타내는 함수의 식을 가설 함수라고 함. 예측값과 실젯값의 오차를 구하는 손실 함수를 이용해 오차를 최소화하면서 예측 정확도 높일 수 있음.
분류
-
대표적 알고리즘 : 로지스틱 회귀, k-최근접 이웃
-
딥러닝의 이해와 활용
인공신경망과 딥러닝
인공신경망과 퍼셉트론
-
퍼셉트론 : 인공신경망을 실제로 구현한 연산 장치, 여러 개의 입력값을 처리하여 하나의 결괏값인 0 또는 1을 출력하는 인공신경망의 가장 작은 단위.
-
-
-
-
-
활성화 함수 : 출력할 값을 조정해 주는 함수로 계단 함수, 시그모이드 함수, 렐루 함수 등이 있음
-
딥러닝의 학습 원리
-
-
활성화 함수
딥러닝에서 일정한 임곗값을 넘는지 판단한 후 정보의 전달 유무를 결정. (대표적 활성화 함수 : 시그모이드 함수, 렐루)
-
렐루 함수
입력값이 0보다 크면 입력된 값을 그대로 출력, 입력값이 0 이하면 0을 출력.
-
딥러닝의 활용 분야
-
음성 인시과 자연어 처리
음성 인식과 자연어 처리 시스템의 동작 원리
-
-
-
특징 추출 : 숫자에서 특징되는 자음, 모음 드으이 음소를 추출
-
-
-
-
의미 분석 : 개체명 분석, 단어의 중의적 표현 등을 파악하여 문맥상 의미를 파악
담화, 의도 분석 : 대화의 맥락을 이해하고 생략된 의도를 파악
-
-
딥러닝으로 손글씨 분류하기
렐루 : 렐루 함수는 입력값 x가 음수이면 0으로 출력하고, x가 양수이면 해당 값인 x를 그대로 출력한다.
소프트맥스 : 소프트맥스 함수는 3개 이상을 분류하는 다중 분류에 사용된다. 예측 확률을 0과 1 사이의 값으로 나타내며, 이때 출력값의 총합은 1로 비율을 파악할 수 있다.
-
-
-