Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습(1401김가은) - Coggle Diagram
인공지능과 학습(1401김가은)
기계학습 유형과 알고리즘
-
기계학습과 알고리즘
지도학습 ㅣ 회귀,분류 알고리즘
비지도학습 ㅣ 군집 알고리즘
지도학습
입력데이터,정답데이터 함께 사용해 모델 학습
오류 여부와 성능 쉽고 명확하게 평가 가능
회귀,분류
-
강화학습
판단할때마다 외부환경에서 보상 제공,이 보상의 값을 최대화하기 위한 방향으로 학습 진행
회귀
요인과 특정 결과 사이의 관계를 함수로 표현해 연속적인 수치
예측하는 기계학습 방법
즉,훈련데이터로 학습한 모델을 사용해 새로운 입력값에 대한 수치 예측하는것
회귀모델 ㅣ 독립변수,종속변수 사이의 규칙을 파악해 수식으로 나타내고 예측값 얻는 모델이다
독립변수는 입력값,종속변수는 결과값
선형회귀알고리즘 있다
-
분류
법ㅁ주로 데이터 구분 위한 경계 학습해 여러범주중 하나를 선택하는것
즉,어떤 클래스에 속하는지를 찾는것
이진분류 ㅣ 2개의 클래스로 분류하는것
다중분류 ㅣ 3개이상의 클래스로 분류하는것
로지스틱회귀,K-최근접 이웃
군집
비지도학습 알고리즘의 일종
어떻게 그룹화 되어야히는지 미리 정의하지 않고 패턴 스스로 찾아내는 방식
정답데이터 가지고 있지 않는 경우이므로 입력된 데이터의 특성을 분석해 서로 유사한 특성을 가진 데이터끼리 그룹화한다
비슷한 특징 분석해 서로 유사한 특성 가진 데이터끼리 그룹으로 묶는것
K-평균알고리즘 ㅣ 가까운 거리에 있는 데이터를 같은 군집으로 할당하고 군집의 중심을 변경되지 않을때까지 계속 바꾸어 조정하는 방식으로 군집 형성한다
-
딥러닝의 이해와 활용
-
인공신경망과 퍼셉트론
인간 신경망 모방하여 컴퓨터로 처리할 수 있도록 구현한것
퍼셉트론 ㅣ 인공신경망 구현한 연산장치,입력값 처리해 하나의 결괏값인 0 또는 1 출력
수상돌기와 같이 데이터 입력받고 축삭돌기에서 다른 뉴론으로 전기신호 보내듯 데이터 출력,노드 또는 인공뉴런이라고 불림
단층 퍼셉트론 ㅣ 입력층 1개,출력층 1개
다층 퍼셉트론 ㅣ 복잡한 문제 처리 위해 은닉층 새로 만든것
-
딥러닝 학습원리
딥러닝에서 학습한다는것은 가중치와 편향 찾아가는 과정 읨비,학습의 최종목표는 최적의 가중치와 편향 찾는것
신호의 세기는 정보의 중요도에 따라 달라짐,중요한 정보는 가중치를 곱하여 전달함
원하는 결과가 잘 나오도록 편향을 더하여 조정한다
최적의 가중치와 편향이란 손실함수의 최솟값으로 기울기가 0인 지점 의미
-
최적화 ㅣ 손실함수의 값이 최소가 되도록 가중치와 편향을 갱신하는 과정 의미,오차역전파를 통해 이루어짐(경사하강법)
경사하강법 ㅣ 아래방향으로 일정거리인 학습률만큼 이동하는 함수
기울기가 0이 되도록 가중치와 편향 수정하며 아래방향으로 일정거리인 학습률만큼 이동함 기울기가 0이 될때까지 학습을 거듭하여 가중치와 편향 수정 경사하강법은 학습할때마다 기울기 구하여 속도 느리고 계산량 많다는 단점 있음
최적화알고리즘 예시 ㅣ 확률적 경사하강법,미니배치 경사 하강법,모멘턴,아담등
-
컴퓨터 비전
영상 분석해 의미있는 정보 추출하는 기술.예시로는 합성곱 신경망이 있다
이미지처리에 높은 성능을 보여준다
합성곱 신경망
합성곱계층,폴링계층으로 구성됨
두 계층을 반복하여 학습을 진행하면서 이미지의 특성을 추출한다
합성곱 계층에서는 필터를 적용하여 이미지의 특성 추출한다
합성곱 계층 연산이 끝나면 풀링 계층에서 그 특성을 잘 드러내는 값 선택하는 과정을 반복해 이미지 인식함
음성인식과 자연어 처리
음성을 텍스트로 변환하는 음성인식기술과 변환된 텍스트를 분석하여 그 의미를 파악하는 자연어 처리기술,음성인식 위한 잡음 제거 및 소리 보정기술,음성을 텍스트로 변환하는 기술등 포함
순환신경망 구조 ㅣ 심층신경망의 구조와 흐름은 비슷함 다음층으로 이어지는 중간 추력을 은닉상태라고 하는데,데이터의 중간 결과를 기억할 수 있다
기계학습과 데이터
전통적 프로그래밍과 기계학습
-
기계학습
데이터를 통해 스스로 학습하고 기계학습 모델을 만들도록 프로그래밍해 문제를 해결할 수도 있다 기계학습 이용하면 데이터간 속성들간의 규칙을 학습해 모델을 생성한 후 데이터의 결과를 판단하거나 예측함
-
문제해결 위한 데이터
대용량의 품질좋은 데이터 필요
질이 좋더라도 데이터의 양이 충분하지 않으면 기계학습 모델의 품질 좋지 않을것
수집한 데이터가 편향을 띈다면 학습한 결과도 정확하지 않다
->기계학습으로 해결할 가능성 낮아짐
사회적,경제적 요인이 복합적으로 작용해 발생한 문제는 데이터 적절히 확보 어려움
다양한 요인 섞여있는 경우 현재상태와 목표상태,핵심요소가 무엇인지 파악하기 어려음
-
데이터 선정하기
문제적합성 ㅣ 관련있는 데이터인가
수집 가능성 ㅣ 수집하기 어려운 데이터 피하기
정보 보호 ㅣ 개인정보 포함 데이터 사용 주의하기
데이터의 품질 ㅣ 정확성,신뢰도 판단하기
데이터 수집비용 ㅣ 비용 고려하기
데이터 수집하기
-
데이터셋 ㅣ 주제별로 모은 데이터의 집합
데이터 포털등의 사이트등에 업로드하면 그것을 내려받아 활용할 수 있다
개인이 만들어낸 공유한 데이터뿐만 아닌 공공기관에서 제공하는 데이터 활용할 수도 있다
데이터를 API 형태로 만들기도 한다
데이터 활용할 때 원 저작권 침해하지 않게 유의
직접 데이터 수집
웹 크롤링,설문조사,인터뷰결과정리
여러 센서를 통해 값을 수집할 수도 있다.
데이터 전처리와 핵심 속성 추출
데이터전처리 ㅣ 결측치,이상치의 유무 파악,문제해결에 필요한 속성이 무엇인지 선별하고 다음 문제 해결에 적합한 데이터로 데이터 가공하는 과정
->기계학습 분석 결과를 왜곡시키거나 성능 떨어뜨리는것 방지 가능
데이터 ㅣ 관찰이나 실험을 통해 수집되는 데이터,여러개의 속성으로 나뉘어있다
데이터속성 ㅣ 데이터 설명하는 특징이나 성질
결측치 처리하기
결측치 있다면 에러발생,기계학습 모델에 부정적인 영향 미침
결측치 처리하는 방법 ㅣ 결측치 있는 행이나 열 삭제,평균,중앙값,최빈값등의 대푯값으로 결측치 대체하는 방법
주의할 점 ㅣ 삭제된 행이나 열이 필요한 데이터인지 따직 신중하게 적용해야함
이상치 처리하기
이상치 ㅣ 데이터의 범위보다 지나치게 높거나 낮은 수치값
이상치 처리 방법 ㅣ 정상범위의 기준 정해야함 (데이터 시각화 속성들의 분포 살펴보기)
데이터 충분하다면ㅣ 이상치 포함하는 행 삭제 가능
하지만 맥락 보며 신중하게! 데이터 충분하지 않다면 적합한 값을 대체
-
히트맵으로 핵심속성 추출하기
필요한 핵심속성 찾을떄 데이터 시각화 하면 직관적으로 판단 가능
히트맵 ㅣ 상관관계 시각화한 그래프로, 색을 이용해 배열 나타냄
해결하고자 하는 문제와 관련깊은 핵심속성들을 상관계수로 찾아내기가 시워짐
1.0에 가까울수록 상관관계 커진다 한 변수가 증가할떄 다른변수도 증가하는 경향 보이면 양의 상관관계 한 변수 증가할때 다른변수 감소하는 경향 보이면 음의 상관관계
-
딥러닝으로 손글씨 분류하기
-
기계학습과 딥러닝의 차이점
기계학습 ㅣ 문제해결에 필요한 핵심속성을 사람이 추출,많은 시간 소요되고 속성 잘못 추출하면 기계학습의 성능 떨어짐