[HeidiSQL] SQL 오류 (42): File '\EXERCI~1.CSV' not found (Errcode: 42)
·
Data Engineer/Database
[HeidiSQL] SQL 오류 (42): File '\EXERCI~1.CSV' not found (Errcode: 42)발생 상황CSV 파일 가져오기를 통해 .csv 파일을 가져오려 하였으나 SQL 오류 (42): File '\EXERCI~1.CSV' not found (Errcode: 42) 발생exercise1.csv 파일을 경로로 지정하였으나 오류화면에는 EXERCI~1.CSV로 출력되고 있다. 오류 원인 예측1. HeidiSQL이 내부적으로 경로를 변환하는 과정에서 W\를 하나 더 붙여버리는 상황으로 추정된다. 2. "귀뚜라미"로 지정된 한글 경로가 문제일 가능성이 있다. 3. 테이블명이 W와 충돌했을 가능성이 있다. 실제 해결 방법예측한 오류 원인 중 가장 유력했던 것은,한글 경로가 문제일 것..
[HeidiSQL] SQL 오류 (3948): Loading local data is disabled; this must be enabled on both the client and server sides
·
Data Engineer/Database
[SQL 오류 (3948): Loading local data is disabled; this must be enabled on both the client and server sides] HeidiSQL을 사용하여 Database 작업을 진행하던 중 아래와 같은 오류가 발생하였다. 발생 상황 CSV 파일을 가져오는 과정에서 새 테이블 생성 후 가져오기 진행시 오류 발생 오류 원인처음 MySQL 설치시 Local Data를 가져오는 권한이 없다.마음대로 가져오고 내보내는게 어떻게 보면 좋은 상황은 아닐 수 있기 때문에 오류가 발생하도록 설정되어있다. 해결방법Local 데이터를 가져올 수 있도록 권한을 허용해줘야한다. 1. 아래 SQL문을 입력해서 local_infile의 Value값을 확인한다. ..
[Python] LSTM (장기 의존성 학습 모델)
·
Data Analysis & Scientist/Python
RNN 구조에서 발생하는 문제를 해결하기 위해 구조를 변경한 모델이다.기존의 RNN은 학습 횟수가 증가하면 과거의 기억을 잃었었다.(반복 학습을 하면서 가중치의 변화량이 0에 가까워지고, 손실함수 -> tanh -> 반복적으로 -1 ~ 1의 가중치의 변화량이 곱해지면서 0에 수렴해 기억 손실이 나타났다.) LSTM 모델은 반복 학습을 하면서 과거의 기억 중 장기 기억과 단기 기억으로 나눠주는 역할을 한다.- 반복 학습을 하면서 hanh() 중복적으로 실행하면서 기울기는 0에 가까워짐- 장기 기억 tanh() 함수를 실행하지 않는다. -> 가중치의 변화를 유지- cell 공간에 장기 기억 정보를 전달- 게이트로 정보를 선택적으로 보관, 삭제, 출력 연습문제#### 연습 1. DataSet를 생성 -..
[Python] DBSCAN (밀도 기반 군집화)
·
Data Analysis & Scientist/Python
- 밀도 기반의 클러스터링 알고리즘으로 데이터의 밀도를 이용하여 군집을 생성- 데이터가 빽빽한(고밀도) 지역을 하나의 군집으로 생성을 하고 드문(저밀도) 지역은 노이즈(이상치)로 판단- KMeans와는 다르게 군집의 개수를 지정할 필요 없다.- 비선형 구조의 데이터에서도 군집 형성이 가능 (원형, 나선형의 구조 데이터에서 패턴 분석 가능)- 노이즈를 판단함으로 이상치에 대한 자동 감지- 스케일링은 일반적으로 사용 (Standard, min-max)
[Python] 교차검증
·
Data Analysis & Scientist/Python
Pipeline- 여러 단계 (전처리, 변환, 추정)를 연속적으로 연결하여 실행하는 도구- 전처리 과정과 학습 모델을 하나의 객체(class)로 결합하여 사용- 교차 검증 (kfold), 파라미터 탐색(Gidsearch)에서 유용- 데이터 누수 방지 : scaler를 사용하는 경우에는 train data만 자동으로 fit하고 test는 transform GridSearchCV- 하이퍼 파라미터(매개변수) 조합을 탐색하여 최적의 조합을 찾는 방법- 각 파라미터 조합별로 교차검증(CV)을 수행해 평균 성능을 비교- 최적의 모델과 성능을 자동으로 제공 KFold- 데이터 셋을 K개의 동일 크기 부분(Fold)으로 나눠서 K번 반복하여 하나의 폴드를 검증용으로 사용을 하고 나머지 K-1개의 폴드를 학습용으로 ..
[ML/Python] 분류 분석 (DecisionTreeClassifier) (matplotlib, sklearn, pandas)
·
AI
use skill: matplotlib, sklearn, pandas 분류 분석이란?- 조건식을 이용하여 데이터를 분할해가면서 정답을 찾아가는 과정- 불순도 - 종속 변수의 혼합도 - 분류 : 지니 지수, 엔트로피, 로그 손실 - 회귀 : 분산 감소, MSE, MAE * DecisionTreeClassifier (분류)- 라이브러리 로드import matplotlib.pyplot as pltfrom sklearn.tree import DecisionTreeClassifier, plot_treeimport pandas as pd - iris 데이터 로드 head를 확인해보니 해당하는 품종 그대로 있다.위 데이터로 작업 진행 # 분류 모델에서 사용 (모델에 넣어서 tree구조 어떻게 나..
[ML/Python] 산점도 그래프 및 회귀 분석 (pandas, matplotlib, seaborn, numpy, sklearn)
·
AI
기존 가지고 있던 boston.csv 엑셀 파일로 산점도 그래프 및 회귀 분석 실습을 진행해 보았다.skill: pandas, matplotlib, seaborn, numpy, sklearn## 회귀 분석- 특정한 값을 찾아내는 과정 ( 기기가 스스로 데이터간의 규칙을 찾아내는 과정 )- 평가 지표 - MAE - 실젯값과 예측값의 차이에 절대값으로 평균을 구한 값 - MSE - 실젯값과 예측값의 차이를 제곱한 뒤 평균을 구한 값 - RMSE - MSE에 루트를 씌운 값 - MSLE - MSE 값에 로그를 적용한 값 - MAPE - MAE를 퍼센트로 표시 - R2 Score - 가장 대중적으로 사용..
머신 러닝 기초 이론 정리
·
AI
머신 러닝의 기본 과정데이터의 수집 -> 학습할 자료를 수집 (DataBase, Open API, 크롤링)데이터 전처리 -> 결측치, 이상치, 정규화등모델 선택 -> 회귀, 분류, 트리, 신경망 등 데이터에 맞게 선택훈련 -> Train 데이터를 이용한 학습 ( 기기가 스스로 규칙 발견 )평가 -> 새로운 데이터를 이용하여 성능을 검증예측 -> 실제 상황에서 적용 머신 러닝의 종류지도 학습 : 정답이 있는 데이터를 학습, 회귀·분류비지도 학습 : 정답이 없는 데이터에서 패턴을 찾음, 군집화 · 이상치 감지 · 차원 축소강화 학습 : 보상을 통해 행동을 학습, 로봇 제어 · 게임 플레이 회귀 분석의 성능 평가 지표MAE- 실제의 값과 예측 값의 차이를 절댓값으로 변환하여 평균을 구한 값- 에러의 크기가 그..
[Python] 데이터 스케일링
·
Data Analysis & Scientist/Python
대부분의 분석 알고리즘은 컬럼 간 데이터의 범위가 크게 차이나는 경우 정상적으로 작동하지 않는다. ( 성능이 떨어진다. )값의 범위가 작은 컬럼에 비해서 범위가 큰 컬럼이 종속 변수를 예측하는데 큰 영향을 준다고 판단하기 때문. 실제로 업무에서 문서를 학습시킬 때 위와같은 상황때문에 학습을 시켰더라도 원하는 값이 나오지 않아 굉장히 곤란했던 적이 있다.그럴때 사용했던 방법이 데이터 스케일링 작업이다.문서의 비율을 맞춰서 각각의 문서값을 정상적으로 도출해낼 수 있도록 한 경험이 있다.모든 문서를 다 하는것은 아니었고, 영향력이 높은 문서라면 일부러 스케일링을 안하는 경우도 있었다. 스케일링 작업은 모든 컬럼의 값의 범위를 같게 만들어주는 작업으로,스케일링 작업 전에 이상치 데이터를 대체하거나 삭제하는 작업..
AI Agent 구조의 이해 (ft.자동화 마인드셋)
·
Automation
AI Agent는 코딩도 중요하지만 사람의 판단(관점)이 가장 중요한 영역이라고 생각합니다.어디까지 자동화가 가능할지, 어떻게 자동화를 구현해낼지에대한 사람의 판단이 굉장히 중요한 영역입니다. 사람의 개입이 필요한 영역에 개입이 들어가지 않는다면 손실이 발생할 수 있고, 사람의 개입이 필요없는 영역에 개입이 들어간다면 불필요한 손해가 발생할 수 있습니다. 무작정 "100% 자동화 가능" 이라는 마인드보다는, "업무를 대체할 수 있는 영역을 판단하고 최대한 손실없이 자동화를 진행한다" 의 마인드가 조금 더 가까울것 같습니다. LLM을 사용하여 개발을 진행한다면 늘 완벽한 답변만 나올순 없습니다. 그래서 꼭 필요한것이 "검증" 단계입니다.따라서 자동화 프로세스에서는 "검증 구조를 설계"합니다. 한번 개발한 ..