오렌지에서 Decision Tree 와 Logistic Regression 정확성 비교를 해보겠습니다. 먼저 연습에서 자주 사용되는 가공되기 전의 Titanic 데이터를 다운받습니다. Titanic 이번에는 titanic.xls입니다.
2022년 5월 19일 목요일
오렌지에서 Decision Tree 와 Logistic Regression 정확성 비교
R RStudio 설치 및 Jupyter notebook과 연동
오렌지를 콘다로 설치해보았으면 R도 같은 방법으로 설치해보고, 불 필요하면 깔끔하게 지워버릴 수 있습니다. 아래는 나무위키에 있는 R의 장점입니다.
- 데이터 클리닝관련 패키지도 다양하게 지원하기 때문에 데이터를 상황에 맞게 자유자재로 다루기가 수월하다.
- reticulate 패키지를 이용하여 Python 의 라이브러리들을 쉽게 활용할 수 있다.
- 웹 어플리케이션 개발 프레임워크인 Shiny의 고도화로 통계 또는 머신러닝 모델을 웹과 연동할 수 있다.
1. R을 오렌지와 같은 가상환경에 설치 할 수 있으나, 별도로 가상환경을 만들고 그곳에 설치합니다.
하면 조금 시간이 걸리기는 하지만 설치가 됩니다.
하여 R을 사용 할 수 있는
2. 통합환경인 RStudio를 실행합니다.
jupyter notebook 시행은
하면 자신이 사용하는 인터넷 탐색기에 아래와 같이 jupyter를 실행하게 됩니다.
4. 기본으로 파이썬이나 R용 노트를 사용할 수 있게됩니다. TAB 키를 이용하여 코드인사잇(자동완성) 기능을 사용 할 수 있습니다.
불필요하면 아래와 같이 깔끔하게 가상환경을 삭제해버릴 수 있습니다.
2022년 5월 18일 수요일
파이썬(또는 오렌지)를 설치하면서 같이 설치되는 패키지들 중 ipython 사용방법
오렌지를 Miniconda로 설치하는 방법을 이곳에서 설명하였습니다.
1. 오렌지를 설치하면 당연히 맥의 경우 터미널에서 python을 사용할수 있겠지요. 사용하기가 좀 불편합니다.
2. 편리한 ipython을 사용하기위해서는 Seaborn 이라는 패키지가 필요합니다. Seaborn은 Matplotlib을 기반으로 다양한 색상 테마와 통계용 차트 등의 기능을 추가한 시각화 패키지입니다. 기본적인 시각화 기능은 Matplotlib 패키지에 의존하며 통계 기능은 Statsmodels 패키지에 의존합니다. Matplotlib는 오렌지와 같이 설치되어 있으니 Seaborn을 설치 합니다.
ModuleNotFoundError: No module named 'seaborn'
일단은 Exit()하여 빠져나오고
3. seaborn을 설치합니다.
덩달아서 통계 기능을 하는 Statsmodels 패키지도 깔립니다.
4. 터미널에서 ipython이라고 입력하여 실행하고 코드를 입력하면 TAB키를 이용하여 자동완성기능(코드인사잇)을 이용할 수 있습니니다.
2022년 5월 16일 월요일
오렌지 카이제곱(독립성) 검정2
카이제곱(독립성) 검정은 Orange3로 통계강의 따라하기 05 (비율검정 카이제곱 chi2)에서 파이썬 스크립트를 이용하여 구했습니다. 이러한 데이터로 주어질경우에는 다음 방법으로도 할 수 있습니다. 자꾸 햇갈려서....
1. 먼저 연습에서 자주 사용되는 가공되기 전의 Titanic 데이터를 다운받습니다. Titanic
오렌지에서 이상치 처리는 Outliers Wedget으로
오렌지에서 이상치 데이터를 처리하는 위젯은 Outliers Widget을 사용합니다. Row Select Widget에서도 수동으로 값을 입력하여 처리할 수 있습니다.
1. 먼저 연습에서 자주 사용되는 가공되기 전의 Titanic 데이터를 다운받습니다. Titanic
오렌지에서 Missing Data 처리 (Impute Widget)
오렌지에서 이빨빠진 데이터를 처리하는 위젯은 Impute Widget을 사용합니다.
1. 먼저 연습에서 자주 사용되는 가공되기 전의 Titanic 데이터를 다운받습니다. Titanic
2. 오렌지의 캔바스를 아래와 같이 배치하고 연결합니다.
3. File Widget을 선택하고 위에서 불러온 Titanic.csv 데이터를 읽어 옵니다.
(4)에서 이빨 빠진 데이터가 2.5% 임을 확인합니다.오렌지로 해보는 데이터 결합 연습 Merge Data (Inner Join)
오렌지와 유사한 프로그램으로 상용(유료) 프로그램인 Rapidminer에 있는 데이터 결합 예제를 오렌지로 구현해 보았습니다.
1. 오렌지의 캔바스를 아래와 같이 구성하고 연결합니다.
3. File Wedget을 선택하고 마우스오른쪽 버튼하고 [Rename F2]를 선택해 각각 Products, Transaction으로 이름을 바꾸고, 각각 저장된 파일을 불러옵니다.
3. Merge Data Wedget을 선택하고 아래와 같이 실정합니다.
2022년 5월 14일 토요일
오렌지 KNN Model에서 K값의 변화에 따른 정확도 측정
오렌지의 많은 기능이 맘에 들지만 Line Plot Wedget은 마음에 들지 않습니다. 직관적이지 않아요. 그러나 타임시리즈에 있는 Line Chart Wedget을 이용하면 땜빵은 됩니다. 다만 0부터 시작한다는 점이 접접...
1. 오렌지의 캔바스에 아래와 같이 배치하고 연결합니다. 2개의 그룹을 하나의 캔바스에 구성하였습니다.
2. File Wedget을 선택하여 앞에서 사용한 diabetes.csv 파일을 읽어 옵니다. 케글에서 다운받으세요. Outcome을 target으로 지정하였습니다.
3. Data Sampler Wedget을 선택하여 Fixed proportion of data = 60% 로 설정합니다.
KNN Wedget의 (1)Number of neighbors 값을 1 ~ 11 까지 변동 시키면서
Test and Score Wedget을 Test on train data 와 Test on test data를 번갈아 가면서 선택 했을 때의 CA 값을 읽어
Create Table Wedget에 입력합니다. Test on train data는 2번컬럼에 Test on test data는 3번 컬럼에 입력합니다.
5. Select Columns Wedget을 선택하고 아래와 같이 설정합니다.
6. Line Chart Wedget을 선택하여 결과를 확인합니다.
이처럼 K 값(이웃의 갯수)을 변경함에 따라 학습때와 테스트때의 차이가 적게 되는 K 값을 KNN Model을 이용한 분석에 사용합니다. 여기서는 K=10 이군요.
델파이의 부활(Antigravity와의 만남)?
델파이 프로그램을 사용하여 개인적으로 필요한 프로그램을 생성해 왔는데, 얼마전부터 파이썬으로 옮겨갔다. 그런데 Google 의 Antigravity를 만나고 나서 델파이에 대한 미련을 버리지 못해 제미나이가 Delphi이에 대한 학습도 엄청 했을...
-
윈도우10에 있는 음성 녹음기는 간단하게 녹음 할 때 간편하고 좋다. 곰 녹음기를 사용하면 오늘기준으로 CPU 점유율이 35% 이상 올라가 맥의 팬이 돌아간다. 윈10의 음성녹음기는 좋은 데 저장 폴더가 디폴트로 되어 있어 사용하기 불편하다. ...
-
해당 comfyui 가상 환경에 설치하여야 함 cd C:\Users\jglee\AppData\Roaming\StabilityMatrix\Packages\ComfyUI PS C:\Users\jglee\AppData\Roaming\StabilityMatr...
-
오렌지에서 이상치 데이터를 처리하는 위젯은 Outliers Widget을 사용합니다. Row Select Widget에서도 수동으로 값을 입력하여 처리할 수 있습니다. 1. 먼저 연습에서 자주 사용되는 가공되기 전의 Titanic 데이터를 다운받습니...






















































