Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습(1122 정동현) - Coggle Diagram
인공지능과 학습(1122 정동현)
기계 학습과 데이터
전통적 프로그래밍과 기계학습
컴퓨터는 빠르고 정확한 계산 능력을 바탕으로, 정해진 규칙대로 수행하는 자동화 능력을 이용해 문제를 해결한다. 기계학습이 등장하기 전의 전통적 프로그래밍을 이용한 문제 해결 방식은 이러한 자동화 능력을 구현하기 위해 규칙을 프로그래머가 직접 만들고, 규칙을 표현한 알고리즘에 데이터를 입력하면 컴퓨팅 시스템이 알고리즘에 따라 처리한 결과를 출력한다
-
문제 해결을 위한 데이터
훈련 데이터의 질이 좋지 않거나 질이 좋더라도 데이터의 양이 충분하지 않으면 기계학습 모델의 성능은 높지 않을 것이다. 또한 수집한 훈련 데이터가 편향을 띤다면 이 데이터를 이용한 학습 결과도 정확하지 않을 것이다
편향: 한쪽으로 치우치는 성질을 의미한다. 데이터 편향은 데이터가 특정 방향으로 치우치거나, 데이터 간 속성과의 관계를 균형 있게 고려하기 어려운 경우 에 발생한다
데이터 수집하기
데이터셋은 주제별로 모은 데이터의 집합을 의미한다, 데이터 분석가들이 분석을 위해 가공한 데이터들을 데이터 포털 등의 사이트에 업로드하면 그것을 내려받아 활용할 수 있다 개인이 만들어 공유한 데이터 뿐만 아니라 여러기업이나 공공기관에서 제공하는 데이터를 활용할 수도 있다. 기업이나 공공기관에서는 데이터셋을 파일 또는 API 형태로 만들어 공공데이터로 제공하기도 한다
-
데이터 포털 등 인터넷에서 원하는 내용을 수집하기 어렵다면, 직접 데이터를 수집할 수도 있다. 인터넷 검색 및 웹크롤링, 설문조사, 인터뷰 결과 정리 등 다양한 방식을 통해 데이터를 정리할 수 있으며, 피지컬 컴퓨팅 도구와 컴퓨팅 시스템, 웨어러블 기기 등을 이용해 여러 센
서를 통해 값을 수집할 수도 있다
웹크롤링: 자동화된 방법으로 웹을 탐색하는 프로그램을 통해 웹 페이지에 들어 있는 데이터를 긁어 모으는 것을 말한다. 웹에 존재하는 게시글, 특정 단어, 문장, 뉴스 댓글, 후기,SNS 게시글 등 다양한 데이터를 수집 할 수 있다
데이터 전처리와 핵심 속성 추출
기계학습에 사용할 데이터를 선정하고 수집한 후에는 데이터 전처리 과정이 필요하다. 데이터 전처리란 결측치와 이상치의 유무를 파악하고 문제 해결에 필요한 속성이 무엇인지 선별한 다음 문제 해결에 적합한 형태로 데이터를 가공하는 과정을 말한다
-