Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습 (1118 이동현) - Coggle Diagram
인공지능과 학습 (1118 이동현)
기계학습과 데이터
기계학습과 문제 해결
전통적 프로그래밍과 기계학습
전통적 프로그래밍은 자동화를 위해 규칙을 프로그래머가 직접 만들고, 규칙을 표현한 알고리즘에 데이터를 입력하면 컴퓨팅 시스템이 알고리즘에 따라 처리한 결과를 출력한다,
우리는 컴퓨터가 스스로 학습하고 프로그래밍해 문제를 해결할 수 있으며기계학습 모델도 민들고, 새로운 입력 데이터의 결과를 판단하거나 예측한다.
전통적 프로그래밍: 'A라는 입력에 B라는 규칙을 적용해 Y를 출력한다' 즉, 원리나 규칙을 찾아 프로그램을 작성한다.
기계학습: A라는 데이터가 입력될 때 결과가 Y가 되는 규칙 B' 즉, 입력된 데이터로부터 규칙을 도출해 예측하는 프로그램
기계학습을 통한 문제 해결 과정
훈련 데이터: 이를 바탕으로 학습하고, 규칙을 발견해 기계학습 모델을 만든다. 즉, 인공지능에 입력하는 데이터이다.
기계학습 모델: 문제 해결을 위해 사용할 데이터를 적용하면 결과값이 나온다. 즉, 데이터와 기계학습 알고리즘을 이용해 규칙을 찾고 이를 근거로 판단을 내리는 프로그램을 뜻한다.
기계학습으로 해결할 수 있는 문제인지 여부: 훈련 데이터의 양과 질, 활용하는 프로그램의 성능, 앞으로의 기술 발전 양상
문제 해결을 위한 데이터
인공지능은 훈련 데이터를 바탕으로 학습하기에 대용량의 품질 좋은 훈련 데이터가 필요하다. 이 밖에도 훈련 데이터가 질이 낮거나, 데이터의 양이 충분하지 않거나, 편향을 띤다면 학습 결과는 좋지 않을 것이다.
데이터가 편향을 띠지 않을려면 개인의 주관이 들어가지 않고, 편향성이 있는지 확인하고, 데이터셋에 어떤 데이터 인지도 함께보관한다.
데이터의 공정성
-
데이터 처리 및 분석의 공정성: 분석과 모델도 편향성을 띠지 않고, 불공정한 결과가 나와선 안된다.
-
-
-
데이터 선정 및 수집하기
문제 해결과 관련 있는 데이터를 학습해 적합한 모델을 생성하는 것이중요하다. 성능이 좋지 않다면 훈련 데티어 추가, 변경 또는 다시 학습시킴다.
데이터 선정하기
-
기계학습을 위한 데이터를 선정
-
수집 가능성: 수집할 수 있는 데이터를 선정한다,
정보 보호: 개인 정보 포함, 저작권 침해의 문제 등이 없는지 살펴본다.
데이터의 품질: 데이터 정확성, 신뢰도 떨어지는 데이터는 제외한다.
-
데이터 수집하기
-
-
-
데이터를 직접 모으고 싶다면 인터넷 검색, 웹크롤링, 설문 조사, 인터뷰 결과 정리 등이 있다.
데이터 전처리와 핵심 속성 추출
-
핵심 속성 추출하기
데이터는 관찰이나 실험을 통해 수집되는 값이며, 하나의 데이터는 여러 개의 소성들로 구성되어 있다.
-
-
-
기계학습의 유형과 알고리즘
기계학습의 유형
-
-
-
-
-
-
지도학습
지도학습은 입력 데이터와 정답 데이터를 함께 사용하여 기계학습 모델을 학습시키는 방법이다. 학습 결과에서의 오류 여부와 성능을 쉽고 명확하게 평가할 수 있다. 지도학습은 훈련 데이터, 테스트 데이터를 사용한다.
-
-
-
강화학습은 외부 환경에서 보상을 제공하고, 이 보상의 값을 최대화하기 위한 방향으로 학습을 진행한다.
기계학습 알고리즘의 이해
-
회귀
회귀는 영향을 미칠 수 있는 여러 요인과 특정 결과 사이의 관계를 함수로 표현해 연속적인 수치를 예측하는 기계학습 방법으로 즉, 새로운 입력값에 대한 수치 결과를 예측하는 것이다.
회귀 모델은 훈련데이터를 기반으로 독립 변수, 종속 변수 사이의 규칙을 파악하고 수식해야 한다.
독립변수: 종속 변수에 영향을 미치는 변수로, 결괏값을 의미한다.
종속변수: 예측하고자 한는 변수로, 입력값을 의미한다.
-
-
-
-
분류
분류는 미리 정의된 여러 범주로 데이터 구분하기 위한 경계를 학습하여 새로운 입력이 들어오면 여러 범주 중 하나를 선택하는 과정이다. 분류를 이용한 기계학습은 이진 분류와 다중 분류가 있다.
분류 모델: 로지스틱 회귀, k-쵝근접 아웃 앍고리즘 등이 있다.
-