Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습
(1505 김주연), 2.5 딥러닝의 이해와 활용, (2) 데이터 전처리와 핵심 속성 추출
(1505 김주연),…
기계학습과 데이터
전통적 프로그래밍과 기계학습
자동화 능력을 구현하기 위해 직접 만듦
-
데이터 속성들 간의 규칙을 학습, 모델을 생성한 후 새로운 입력 데이터의 결과 판단/예측
-
-
데이터 공정성
데이터 수집, 처리, 사용, 공유 과정에서의 공평성과 투명성을 의미
-
-
데이터 선정하기
해결하고자 하는 문제와 관련 있는지 확인, 데이터의 수집 가능성, 정보 보호 여부, 데이터의 품질, 데이터 수집 비용 등 조건에 부합하는 데이터를 선정
문제 적합성 : 해결하고자 하는 문제와 관련 있는 데이터인지 확인
수집 가능성 : 수집할 방법이 없거나 수집하기 어려운 데이터는 피하고, 수집할 수 있는 데이터를 선정
정보 보호 : 선정하려는 데이터가 개인 정보를 포함/저작권 침해의 문제가 없는지 살펴봐야 함
데이터의 품질 : 데이터의 정확성/데이터 제공자의 신뢰도가 떨어지는 데이터는 제외
데이터 수집 비용 : 데이터를 수집하는 데 드는 비용을 고려하여 선정
데이터 수집하기
고려 사항 : 1. 기계학습을 위해 충분항 양의 데이터인가?
- 편향되지 않은 데이터인가?
- 필요한 속성에 대한 내용을 담고 있는 데이터인가?
- 신뢰 가능한 최신의 데이터인가?
데이터셋 : 주제별로 모은 데이터의 집합
업로드하면 그것을 내려받아 활용 가능, 개인이 만들어 공유한 데이터뿐만 아니라 여러 기업/공공 기관/API 형태로 제공하기도 함
-
원하는 내용을 수집하기 어렵다면, 직접 데이터를 수집할 수 있다. 웹트롤링, 설문 조사, 인터뷰 결과 정리 등 다양한 방식을 통해 데이터를 정리 가능.
문제 해결을 위한 데이터
대용량의 품질 좋은 훈련 데이터 필요, 질이 좋더라도 데이터 양이 불충분하면 성능은 높지 않음, 훈련 데이터가 편향을 띤다면 데이터를 이용한 학습 결과도 정확 X
예) 체형에 따라 옷의 사이즈를 추천, 키/팔과 다리의 길이 등 신체적 특성 필요
하지만 훈련 데이터의 양이 너무 적거나, 양이 충분하더라도 체형을 분석하기에 적합한 속성이 부족하거나, 한쪽으로 치우친 데이터만 사용한다면 정확한 모델 생성하기 어려움, 기계학습으로 해결할 가능성이 낮아짐
과거의 구입 이력, 최근 클릭한 상품 목록 등의 데이터가 충분히 있다면, '이전 기록을 바탕으로 상품을 추진하는 시스템을 만들자'라는 문제는 해결할 가능성이 높은 문제임
2.5 딥러닝의 이해와 활용
-
-
-
음성 인식 + 자연어 처리
.
-
자연어 처리: 변환된 텍스트의 의미 분석, 문장 이해
예: 인공지능 스피커, 번역기, 챗봇, 감성 분석
음성 인식 과정
- 음성 입력
- 잡음 제거 + 특징 추출
- 딥러닝 분석
- 텍스트 변환
-
컴퓨터 비전
-
대표적으로 합성곱 신경망(CNN) 사용
CNN이 좋은 이유 : 이미지의 형태를 그대로(2차원) 사용해 특징을 잘 추출함,
기존 신경망처럼 이미지를 1차원으로 바꾸지 않아도 됨
-
활용: 차량 탐지, 사람 탐지, 보안 검색, 이미지 분류·탐지·분할
-
순환 신경망
-
-
활용: 음성, 자연어, 감정 분석, 시계열 데이터
-
-
지도학습, 비지도학습, 강화학습
지도학습 : 데이터를 이용하여 학습할 때 사전에 정답이 있는 데이터를 활용하여 학습하는 것
비지도학습 : 정답을 알려주지 않고 데이터만을 제시하여 학습하는 방법
강화학습 : 답을 직접 알려주지 않고 컴퓨터가 제시한 답안에 대해 보상을 다르게 줌으로써 정답에 가까워지도록 하는 방법
-
-
강화학습은 판단할 때마다 보상을 제공하고, 보상의 값을 최대화하기 위한 방향으로 학습을 진행
-
-
-