Please enable JavaScript.
Coggle requires JavaScript to display documents.
인공지능과 학습(1402 김나은) - Coggle Diagram
인공지능과 학습(1402 김나은)
기계학습과 데이터
기계학습과 문제 해결
-
기계학습을 통한 문제 해결 과정
인공지능: 훈련 데이터로 학습. 규칙 발견, 기계학습 모델 생성
학습된 기계학습 모델에 문제 해결을 위해 사용할 데이터를 적용하면 결괏값이 출력됨.
문제 상태 정의: 현재 상태와 목표 상태가 무엇인지, 활용해야 하는 핵심 요소는 무엇인지.
기계학습을 통해 해결할 수 있는 문제인지 확인: 훈련 데이터의 양과 질, 활용하는 프로그램의 성능, 앞으로의 기술 발전 양상에 따라 달라질 수 있으므로 명확하게 정의하기는 어려움.
충분한 양과 우수한 품질을 갖춘 데이터가 있는지와 이를 활용해 적합한 모델을 생성할 수 있는지 여부에 따라 기계학습으로 해결할 가능성이 높은 문제와 낮은 문제를 구분할 수 있음.
문제 해결을 위한 데이터
-
훈련 데이터의 양이 너무 적거나, 양이 충분하더라도 적합한 속성이 부족하거나, 한쪽으로 치우친 데이터만 사용한다면 성공적으로 정확한 모델을 생성하기가 어렵고, 기계학습으로 해결할 가능성이 낮아진다.
데이터 편향을 방지하는 방법
- 데이터 수집 시 개인의 주관이 들어가지 않은 데이터를 수집
- 데이터의 양과 질에 편향성이 포함되어 있지 않은지 확인
- 데이터셋에 어떤 데이터가 들어 있는지에 대한 정보를 함께 보관
데이터 공정성
데이터 수집, 처리, 사용, 공유 과정에서의 공평성과 투명성을 의미함.
기계학습 및 인공지능 분야에서 올바른 인공지능 활용을 위해 고려해야 하는 중요한 주제 중 하나.
- 데이터 수집 과정의 공정성
- 데이터 처리 및 분석의 공정성
- 데이터 사용의 공정성
- 투명성과 설명 가능성
사회적, 경제적 요인이 복합적으로 작용
현재 상태와 목표 상태, 핵심 요소가 무엇인지 판단하기 어려움
인공지능으로 해결할 가능성 낮음
데이터 선정 및 수집하기
-
데이터 선정하기
- 문제 적합성
- 수집 가능성
- 정보 보호
- 데이터의 품질
- 데이터 수집 비용
- 관련 있는 데이터인지 확인
- 수집하기 어려운 데이터는 피하고, 가능한 데이터를 선정
- 개인 정보나 저작권 문제가 있는지 검토
- 정확성이나 신뢰도가 떨어지는 데이터는 제외
- 비용 고려
데이터 수집하기
고려 사항
- 양이 충분한가?
- 편향되지 않았는가?
- 필요한 속성/내용을 담고 있는가?
- 신뢰 가능한 최신의 데이터인가?
데이터셋: 주제별로 모은 데이터의 집합(데이터 포털)
사이트에 업로드하면 내려받아 사용 가능. 개인이 만들어 공유한 데이터뿐만 아니라 기업이나 공공기관이 제공하는 데이터도 활용 가능.
: 원 저작권을 침해하지 않도록 주의하며 사용