Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습(1425 최송희) - Coggle Diagram
데이터 전처리와 핵심 속성 추출
데이터 전처리 하기
결측치, 이상치 유무 파악, 필요속성이 무엇인지 선별 후 해결에 적합한 형태로 가공하는 과정
-
결측치 처리
처리 방법
-
중앙값, 최빈값, 등의 대푯값으로 결측치를 대체하는방법
결측치- 데이터의 값이 비어있거나 누락된 상태
결측치가 있으면 데이터 분석 과정 중 에러 발생, 잘못된 결과가 산출
-
핵심 속성 추출
-
히트맵으로 핵심 속성 추출하기
데이터를 시각화하면 어떤 속성이 문제 해결에 필요한지 직관적으로 판단
가능, 속성간으, 관계 쉽게 파악
막대 그래프, 히스토그램, 원그래프, 산점도, 히트맵 등
주로 하트맵
히트맵- 상관 관계를 시각화함 그래프, 색을 이용하여 배열
해결하고자하는 문제와 관련 깊은 핵심 속성들을 상관 계수 찾기 쉬워짐
-
-
기계 학습과 데이터
-
-
문제 해결과정
훈련데이터로 학습, 규칙 발견 -> 기계 학습 생성 -> 문제 해결을 위해 사용할 데이터 적용하여 결괏값 출력
-
-
-
-
데이터 공정성- 데이터 수집, 처리, 사용, 공유 과정에서의 공평성과 투명성
-
-
-
-
-
데이터 수집하기
고려 사항
- 충분한 양인가
-편향이 없나
-필요 속성이 들어가 있는가
-신뢰 가능한 최신 데이터인가
-
-
-
데이터의 이해와 활용
인공 신경망과 딥러닝
-
퍼셉트론
-
수상 돌기와 같이 데이터를 입력받고, 신경 세포체처럼 입력 받은 데이터를 처리하여 마지막 축삭 돌기에서 다른 뉴런으로 전기 신호를 보내듯 데이터 출력, 노드 또는 인공 뉴런이라 불림
딥러닝
-
장점- 층을 깊계 설계 할수록 더 복잡한 문제 해결 가능
단점- 층이 깊을 수록 계산량이ㅡ많아져 학습시간이 오래 걸리고, 과대 적합이 발생
학습원리- 가중치와 편향을 찾아가는 과정
뉴런에서 다른 뉴런으로 전달되는 신호의 세기는 정보의 중요도에 따라 변화
중요 정보는 높은 가중치를 곱하여 전달. 반대로는 낮은 가중치룰 곱하여 소멸, 원하는 결과가 나오도록 조정 -> 최적의 가중치와 편향이란 손실함수의 최솟값으로 기울기가 0인 지점
손실 함수
손실함수의 값= 예측값 - 실젯값
훈련 데이터를 잘학습했는지 파악하는 함수로 예측값과 실제값의 차이를 구하는 함수, 차이가 크면 최적화를 통해 다시 학습
손실함수의 값이 작을수록 학습이 잘된 좋은 모델
최적화-
손실함수의 값이 최소가 되도록 가중치의 편향을 갱신하는 과정
오차 역전파를 통해 형성, 가장 대표적인 방법은 경사 하강법
경사 하강법- 무작위로 설정된 초기 가중치의 값을 수정하며 아래 방향으로 일정거리인 학습률 만큼씩 이동, 기울기가 0이 될 때까지 학습을 거듭하여 가중치와 편향을 수정하는 것이다. 그런데 경사 하강법은 학습할 때마다' 체 데이터의 기울기를 구하여 속도가 느리고 계산량이 많다는 단점이 존재
손실 함수의 그래프
실제로는 기울기가 0인 지점이 여러 군데 존재할 수 있다. 상대적으로 가장 낮 은 최저점을 글로벌(global)이라 하고, 나머지 최저점을 로컬(local)이라 부른다.
활용 분야
많은 계산량과 대량의 데이터가 필요하지만 데이터 처리 기술의 발전과 컴퓨터 하드웨어의 발달로 인해 다양한 학문 분야 및 응용 분야에서 활용되는 사례 증가,
특히 비정형 데이터를 다룰때 좋은 성능을 내고 있으며, 기존의 기계 학습 알고리즘으로 다루기 어려웠던 분야에서 사용되면서 빠르게 발전하고 있음
-