전체 글 12

FinanceDataReader로 주식 데이터를 데이터프레임 형태로 받아오기

# 첫 날을 기준으로 상대 수익률 그려보기 df_norm = df / df.iloc[0] - 1 df_norm.plot(figsize=(20,6)); plt.title('상대 수익률');​ # 첫 날을 기준으로 상대 수익률 그려보기 df_norm = df / df.iloc[0] - 1 df_norm.plot(figsize=(20,6)); plt.title('상대 수익률');​ df_list[0]​ # 시작 ~ 끝 기간으로 주가 얻어오기 _df_period = fdr.DataReader('005930', '2016-01-01', '2020-12-31') _df_period​ # 미국 시장: NYSE, NASDAQ nyse_list = fdr.StockListing('NYSE') nasdaq_list = f..

코드 10줄로 시작하는 손쉬운 금융 데이터 크롤링 라이브러리 - FinanceDataReader

pip install finance-datareader FinanceDataReader : 주식, 환율, 암호화폐 및 기타 금융 데이터를 제공하는 한국의 온라인 플랫폼 또는 라이브러리입니다. 이 플랫폼은 개발자 및 투자자들이 금융 데이터를 손쉽게 가져오고 분석할 수 있도록 도와준다. : 코스피 , 코스닥, 미국주식시장 , 비트코인 등의 다양한 금융 데이터를 손쉽게 크롤링할 수 있도록 도와주는 python 라이브러리 https://github.com/FinanceData/FinanceDataReader GitHub - FinanceData/FinanceDataReader: Financial data reader Financial data reader. Contribute to FinanceData/Fina..

퀀트 투자의 기본개념 익히기

주식 데이터의 기본구성 - 날짜 : 해당 가격의 시점을 나타냄 - 시가 : 장 시작시 주가 - 종가 : 장 종료시 주가 - 고가 : 당일 최고가 - 저가 : 당일 최저가 - 거래량 : 당일 거래량 CAGR (Compound Annual Growth Rate) : 특정 기간 동안 투자 또는 자산의 연간 성장률을 계산하는 데 사용되는 지표입니다. CAGR은 해당 기간 동안 투자가 시간에 걸쳐 복리로 성장한다고 가정할 때 사용됩니다. CAGR은 주로 가치가 주어진 기간 동안 변동하는 투자 또는 자산의 성과를 평가하는 데 사용됩니다. : 기하평균을 이용해서 구한 연복리 수익률을 의미 기하평균 예를 들어 최초 원금이 1억원이었고 CAGR 15%를 달성할 수 있는 전략으로 20년 투자하면 최종 자산은 약 16억원이..

파이썬 개발 환경

https://wikidocs.net/book/7845 파이썬을 이용한 한국/미국 주식 자동매매 시스템 이 책에서는 파이썬과 한국투자증권의 오픈API를 사용하여 국내 주식과 미국 주식의 자동매매를 하는 방법에 대해 소개합니다. wikidocs.net >> conda activate py38 >> pip install pandas pyqt5 matplotlib https://github.com/sharebook-kr/book-korea-us-stock-trading GitHub - sharebook-kr/book-korea-us-stock-trading: 파이썬을 이용한 한국/미국 주식 자동매매 파이썬을 이용한 한국/미국 주식 자동매매. Contribute to sharebook-kr/book-korea-..

Part 03) 3장 데이터마트 - 기초분석 및 데이터 관리

1. 데이터 EDA(탐색적 자료 분석) - summary()를 이용하여 데이터의 기초통계량 확인 2. 결측값 인식 - 결측값을 처리하기 위해 시간을 많이 쓰는 것은 비효율적 - 결측값 자체가 의미가 있는 경우도 있음 - 가입자의 특성을 유추하여 활용 - 결측값 처리는 전체 작업속도에 많은 영향을 줌 가. 단순 대치법 1. Completes Analysis - 결측값이 존재하는 레코드를 삭제 2. 평균대치법 - 데이터의 평균으로 대치 - 비조건부 : 관측데이터의 평균으로 대치 - 조건부 : 회귀분석을 활용한 대치법 3. 단순확률 대치법 - 평균대치법에서 추정량 표준오차의 과소 추정 문제를 보완하고자 고안됨 - Hot deck 방법 - Nearest Neighbor 방법 나. 다중대치법 - 단순 대치법을 m..

카테고리 없음 2023.05.06

Part 03 ) 3장 데이터마트 - 데이터 변경 및 요약

1. R reshape를 이용한 데이터 마트 개발 가. 데이터 마트 - 데이터 웨어하우스와 사용자 사이의 중간층 - 데이터 마트 내의 대부분의 데이터는 데이터 웨어하우스로부터 복제되거나 자체적으로 수집된다. 나. 요약변수 - 수집된 정보를 분석에 맞게 종합한 변수 - 데이터 마트에서 가장 기본적인 변수로 총 구매 금액, 금액 횟수, 구매여부 등 데이터분석을 위해 만들어지는 변수 - 재활용성 높다 - 자동화하여 상황에 맞게 자동화 프로그램으로 구축 가능 - 기준값의 의미해석이 애매할 수 있다. - 연속형 변수를 그룹핑해 사용하는 것이 좋다 다. 파생변수 - 사용자가 특정조건을 만족하거나 특정함수에 의해 값을 만들어 의미를 부여한 함수 - 주관적 -> 논리적 타당성 갖추어 개발 필요 - 세분화, 고객행동 예..

ADsP 2023.05.06

Part3 ) 4장 통계분석_시계열분석

4절 시계열 분석 1. 시계열 자료 가) 개요 시계열 자료 : 시간의 흐름에 따라 관찰된 값 시계열 데이터의 분석을 통해 미래의 값을 예측하고 경향, 주기, 계절성을 파악 나) 시계열 자료의 종류 1. 비정상정 시게열 자료 - 다루기 어려운 자료로 대부분의 시계열 자료가 여기에 해당 2. 정상성 시계열 자료 - 비정상 시계열을 핸들링해 다루기 쉬운 시계열 자료로 변환 2. 정상성 가. 평균이 일정할 경우 - 모든 시점에서 일정한 평균을 가져야함 - 일정하지 않은 경우 -> 차분 나. 분산이 일정할 경우 - 분산도 시점에 의존하지 않고 일정해야함 - 일정하지 않은 경우 ->변환 다) 공분산도 단지 시차에만 의존, 실제 특정시점 t,s에는 의존하지 않음 라) 정상 시계열의 모습 1) 정상 시계열의 특징 - ..

ADsP 2023.05.05

Part3 - 4장 통계분석) _회귀분석

3절 회귀분석 1.회귀분석의 개요 가. 회귀분석 정의 1. 하나 이상의 독립변수들이 종속변수에 미치는 영향을 추정하는 통계기법 2. 변수들 사이의 인과관계, 변수 예측 & 추론 3. 독립변수가 1개 : 단순선형회귀분석 독립변수 2개 이상 : 다중선형회귀분석 나.회귀분석의 변수 1. 영향을 주는 변수 : 독립변수, 설명변수, 예측변수 2. 영향을 받는 변수 : 종속변수,반응변수, 결과변수 다. 선형회귀분석의 가정 1) 선형성 - 입력과 출력이 선형관계이다 2)등분산성 - 오차의 분산이 일정하다. 무작위적 분포-> 등분산성 가정 만족 3) 독립성 - 입력변수와 오차는 관련 없다. Durbin-waston :시계열데이터 4) 비상관성 - 오차들끼리 상관 없음 5)정상성(정규성) - 오차의 분포가 정규분포를 따..

ADsP 2023.05.05

Part01_비즈니스 모델과 위기요인과 통제방안

3절) 비즈니스 모델 1. 빅데이터 활용 사례 가) 기업 1. 구글: 사용자 로그데이터를 활용한 검색엔진 개발, 기존 페이지랭크 알고리즘 혁신하여 검색 서비스 개선 2. 월마트 : 고객의 구매패턴 분석, 상품진열 나)정부 1. 실시간 모니터링 다) 개인 1. 정치인: 선거 2. 가수 : 음악청취기록 분석 -> 부를 노래 순서 짜기 tech 내용 예시 연관규칙학습 변인들간에 주목할 만한 상관관계가 있는지 찾아내는 방법 커피를 구매하는 사람이 탄산음료를 더 많이 사는가? 유형분석 문서를 분류하거나 조직을 그룹으로 나눌때 ,분류할때 이 사용자는 어떤 특성을 가진 집단에 속하는가 유전자 알고리즘 최적화 ,진화 최대 시청률을 얻으려면 언제 방송? 기계학습 훈련 데이터로부터 학습가능한 알려진 특성을 활용해 예측 기..

ADsP 2023.05.04

Part 03] 5장 6절 연관분석

연관분석 1) 연관규칙 가) 연관규칙분석의 개념 1. 장바구니분석, 서열분석이라고 불린다. 2. 기업의 데이터베이스에서 상품의 구매, 서비스 등 일련의 거래 또는 사건들간의 규칙을 발견하기 위해 적용 3. 장바구니 분석 : '장바구니에 무엇이 같이 들어 있는지' 분석 4. 서열분석 : 'A를 산 다음에 B를 산다' -> 순서 나) 연관규칙의 형태 -> 조건과 반응의 형태 (If-Then) 다) 연관규칙의 측도 1. 산업의 특성에 따라 지지도, 신뢰도, 향상도 값을 잘보고 규칙을 선택해야함. 지지도 : 전체 거래 중 항목 A,B를 동시에 포함하는 거래의 비율 신뢰도 : 항목 A를 포함한 거래 중에서 항목 A와 B가 같이 포함될 확률 향상도 : A가 구매되지 않았을 때 품목 B의 구매 확률에 비해 A가 구매..

ADsP 2023.05.02