스택
Python, NLTK, PostgreSQL, AWS 인프라.
케이스 스터디
대규모 공개 트윗 이력을 대상으로 수집, 저장, 감성 점수화를 하나의 흐름으로 연결해 tone change를 추적했습니다.
스택
Python, NLTK, PostgreSQL, AWS 인프라.
개요
저는 대규모 공개 트윗 이력에서 tone이 시간에 따라 어떻게 달라지는지 보고 싶었습니다. 흥미로운 부분은 감성 점수 자체만이 아니라, 그 텍스트를 꾸준히 수집하고 저장하고 처리하는 전체 흐름을 만드는 일이었습니다.
공개 소셜 데이터는 멀리서 보면 단순해 보이지만, 수집과 저장을 진지하게 다루기 시작하면 바로 data engineering 문제가 됩니다.
과거 트윗을 수집해 AWS 위 PostgreSQL에 저장하고, NLTK의 VADER sentiment scoring을 적용해 감정 변화의 시간축 뷰를 만들었습니다.
이 프로젝트가 유용했던 이유는 scoring step만 따로 떼지 않고, 텍스트 분석을 실제 저장·조회 레이어와 연결했기 때문입니다.
워크플로우
과거 트윗을 모으고 정규화해, 이후 처리 단계에서 일관된 형식으로 다룰 수 있게 했습니다.
데이터가 단순한 로컬 실험 수준을 넘어가면서, AWS 위 PostgreSQL은 트윗 이력을 저장하고 조회하는 실용적인 기반이 됐습니다.
VADER sentiment scoring을 적용해, 전체 corpus에서 tone이 어떻게 움직였는지 보여 주는 간단한 시간축 신호를 만들었습니다.
결과
데이터
공개 트윗대규모 공개 트윗 이력을 source dataset으로 사용했습니다.
저장
PostgreSQL프로젝트를 notebook-only 실험에 머무르지 않게 했습니다.
분석
VADER가벼운 sentiment 접근으로 추적 가능한 trend signal을 만들었습니다.
배운 점
오래 남는 부분은 감성 점수 숫자 자체보다, 수집부터 저장, 점수화까지 이어지는 end-to-end workflow였습니다.
이 프로젝트는 텍스트 분석을 정적인 파일 위 데모가 아니라, 반복 가능한 데이터 파이프라인처럼 보이게 만들었습니다.
관련 페이지
같은 문제를 다른 각도에서 다루는 케이스 스터디와 방법론입니다.
케이스 스터디
공개 forecasting competition의 asymmetric scoring rule에 맞춰 preprocessing과 예측 로직을 설계해 우승했습니다.