Please enable JavaScript.
Coggle requires JavaScript to display documents.
2.인공지능과 학습(1312 서강윤) - Coggle Diagram
2.인공지능과 학습(1312 서강윤)
기계학습과 데이터
기계학습과 문제 해결
-
전통적 프로그래밍과 기계학습
전통적 프로그래밍: 'A라는 입력에 B라는 규칙을 적용해 Y를 출력한다'는 것을 사람이 작성한다.
기계학습: 'A라는 데이터가 입력될 때 결과가 Y가 되는 규칙 B'를 기계가 찾을 수 있도록 학습시킨다.
문제 해결을 위한 데이터
- 대용량의 품질 좋은 데이터
- 데이터가 편향(한쪽으로 치우치는 성질)을 띄면 안된다.ex)체형에 따른 옷 추천 알고리즘
3.데이터 공정성을 지켜야 한다.
-데이터 수집 과정의 공정성 -데이터 처리 및 분석의 공정성 -데이터 사용의 공정성 -투명성과 설명 가능성
- 다양한 요인이 섞여 있고 현재 상태, 목표 상태, 핵심 요소가 무엇인지 파악하기 어렵다.-모델 생성 어려움
데이터 선정 및 수집하기
-
데이터 수집하기
-
-
인터넷에서 데이터 수집이 힘든 경우 웹크롤링, 방문 수집, 다양한 센서 등을 통해 관련 데이터를 구할 수 있다.
데이터 전처리와 핵심 속성 추출
핵심 속성 추출하기
핵심 속성 이해하기
문제 해결에 필요한 속성만을 사용해야 기계학습으, 성능을 높일 수 있다. 이때 문제 해결에 필요한 속성을 핵심속성이라 함
-
히트맵으로 핵심 속성 추출하기
데이터 찾기 위해 데이터 시각화가 필요하고 시각화 할 때에는 막대 그래프, 원 그래프, 산점도 등이 있지만 그 중 히트맵을 가장 많이 활용한다.
-
상관관계 분석
-
양수는 양의 상관관계 음수는 음의 상관관계를 의미하며 상관계수(r)의 값은 절댓값 1에 가까울수록 두 속성 간 관련성 높은것.
한 변수 증가-다른 변수 증가이면 양으, 상관관계 반대이면 음의 상관관계임
이를 산점도로 나타낼 수 있다.
산점도 그래프는 두 변수 간의 관계를 나타내기 위해 x축의 값과 y축의 값이 교차되는 지점에 점을 찍어 시각화한 것, 맷플롯립 라이브러리의 scatter()함수를 이용하여 그림
데이터 전처리 하기
결측치 처리하기
-
결측치가 있는 행이나 열 삭제하는 방법과 평균, 중앙값, 최빈값 등의 대푯값으로 결측치 대체
-
전처리
결측치, 이상치 유무 파악, 속성 선별, 데이터 가공
기계학습의 유형과 알고리즘
기계학습의 유형
지도학습
입력 데이터, 정답 데이터 모두 사용하여 기계학습 모델 학슴, 결과에서의 오류 여부와 성능 쉽고 명확한 평가 가능, 운현 데이터, 테스트 데이터 사용.
회귀, 분류 가능
비지도학습
입력 디이터만 사용하여 기계학습 모델 학습, 데이터 입력 시 컴퓨터가 데이터를 유사한 속성값을 갖는 그룹으로 묶음. 입력 데이터의 특징 분석하여 패턴, 규칙 찾아냄. 군집 가능
강화학습
판단할 때 보상 재공, 이 보상값을 최대화 하기 위한 방향으로 학습, 현재 상황에서 보상이 더 큰 경우를 선택해 행동, 지능 에이전트 학습 과정에서 유용, 최적화 문제에 주로 이용.
기계학습 알고리즘의 이해
회귀(=예측)
회귀는 어떤 현상에 영향 미칠 수 있는 요인(속성)과 결과 사이의 관계를 함수로 표현해 연속적 수치 예측하는 기계학습 방법, 훈련 데이터 기반으로 독립 변수(주로 입력값), 종속 변수(주로 결괏값) 사이 규칙 파악 수식 나타내고 학습된 규칙에 새 입력값 대입 예측값 얻어냄, 대표적인 선형 회귀 알고리즘.
-
분류
분류는 미리 정의된 여러 범주(=클래스)로 데이터 구분 위한 경계 학습 새 임력 오면 범주 하나 선택하는 과정, 이진 분류(2개 클래스)와 다중 분류(3개 이상 클래스)로 나뉨, 대표적인 로지스틱 화귀, k-최근접 이웃 알고리즘이 있다.
-
군집
군집은 비지도 학습 알고리즘 일종, 컴터가 데이터 패턴을 스스로 찾아내는 방식, 데이터 비슷한 특징 파악, 유사한 데이터 끼리 그룹화함, 전처리 기술로도 사용, 대표적인 k-평균 알고리즘
k-평균 알고리즘은 임의의 군집 중심으로부터 가까운 거리 있는 데이터 같은 군집으로 할당, 군집의 중심을 변겅되지 않을 때까지 계속 바꾸며 조정 방식 군집 형성.
딥러닝의 이해와 활용
인경신경망과 딥러닝
인공신경망과 퍼셉트론
-
퍼셉트론(=노드, 인공 뉴런)은 인공신경망을 실제로 구현한 연상 장치, 입력층 1, 출력층 1이면 단층 퍼셉트론, 여기에 은닉층 까지 있으면 다중 퍼셉트론
딥러닝의 개념
여러 개 은닉층 포함하여 만든 심층 신경망 통해 학습 이루어지는 기계학습 방법, 데이터 정교한 처리, 복잡한 문제 해결 가능, 하지만 학습 시간 오래 걸리고 과대적합 발생 가능
딥러닝의 학습 원리
딥러닝에서 학습이란 가중치와 편향을 찾아가는 과정, 최적의 가중치와 편향을 찾는 것이 최종 목표
중요 정보 높은 가중치 곱하여 전달, 반대는 낮는 가중치 곱하여 소멸, 원하는 결과 나오게 약간 편향 더함, 최적의 가중치와 편향이란 손실함수의 촤솟값으로 기울기가 0인 지점을 의미
손실함수, 최적화, 경사 하강법
손실함수란 훈련 데이터를 잘 학습했는지 파악하는 함수, 작을수록 학습 잘됨
최적화란 손실함수값 최소 되도록 가중치 편향 갱신하는 과정, 오차 역전파 통해 이루어짐, 대표적인 경사 하강법
경사 하강법은 기울기가 0이 될 때 까지 학습 거듭 가중치 편향 수정, 속도 느림 계산량 많음, 단점 보완한 확률적 경사 하강법, 미니 배치 경사 하강법, 모멘텀, 아담 등이 있다.
딥러닝의 활용 분야
컴퓨터 비전
컴퓨터 비전은 컴터를 활용해 정지 영상 동영상을 분석하여 의미 있는 정보를 추출하는 기술, 기존엔 심층 신경망이 있었고 현재엔 합성곱 신경망이 대표적.
심층 신경망
2차원 입력 데이터 1차원 형태로 변환, 2차원 평면에서 가지던 이미지 생긴새 정보 잃음
합성곱 신경망
형태 변환 없이 2차원 입력 데이터 사용, 생김새 정보 그대로 사물을 학습, 크게 합성곱 계층, 풀링 계층으로 구성, 두 계층 반복하며 학습
음성 인식과 자연어 처리
음성 인식과 자연어 처리는 사람이 사용하는 언어를 컴터가 처리하기 위한 기술을 연구하는 분야, 음성을 텍스트로 변환, 잡음 제거, 대표적인 순환 신경망.
순서는 음성입력, 음성인식, 자연어 처리, 명령 수행 및 상호 작용이다.
순환 신경망은 데이터 간의 관계, 순서, 중요한 순차적 데이터 입력 받아 결과 도출 딥러닝 모델, 여기서 중간 출력을 은닉 상태, 이는 데이터 중간 결과 기억 가능, 또한 문장 모두 읽고 최종적 감정 도출 문제에 적합.
-