STEP 05 · DATA COLLECTION

데이터는 어디서
가져올까?

분석은 엑셀 파일을 열기 전부터 시작됩니다. 사내 데이터베이스, 인터넷, 외부 기관의 시스템은 각각 다른 방식으로 데이터를 꺼내 줍니다. 길을 먼저 알면 필요한 기술도 훨씬 덜 낯설어집니다.

THE BIG PICTURE

데이터를 얻는 길은 크게 세 가지입니다

한 줄로 정리하면 이렇습니다. 내 조직 안에 이미 있는 데이터는 DB에서, 웹에 공개된 정보는 화면이나 웹 수집으로, 다른 기관이 제공하기로 한 정보는 API로 받습니다. 같은 “데이터 가져오기”라도 상대가 달라지면 약속과 도구도 달라집니다.

01 · COMPANY DATA

사내 데이터가 있다면: DB 서버와 SQL

DB(Database)는 회사의 데이터가 정리되어 있는 큰 창고입니다. 분석가는 이 창고에서 원본을 통째로 옮겨 온 뒤 엑셀로 다시 정리할 수도 있지만, SQL로 “어떤 데이터를, 어떤 형태로” 받을지 먼저 요청할 수 있습니다.

엑셀 중심 작업수만 행의 원본 데이터를 내려받고, 필터를 걸고, 피벗테이블로 다시 집계합니다.
SQL 중심 작업서버에 먼저 필터와 집계를 요청합니다. 필요한 기간·상품·지역만 골라, 필요한 피벗 결과에 가까운 표를 바로 받습니다.
실무에서의 장점전송량과 반복 작업이 줄고, 같은 기준의 분석을 더 빠르게 다시 실행할 수 있습니다.
SELECT 지역, SUM(매출) AS 총매출
FROM 주문
WHERE 주문일자 >= '2026-01-01'
GROUP BY 지역;
이 문장은 이렇게 읽으면 됩니다. “2026년부터의 주문 중에서, 지역별로 매출을 합쳐서 보여줘.” SQL의 핵심은 복잡한 문법 암기보다 필터(WHERE)집계(GROUP BY, SUM·COUNT 등)를 요청하는 언어라는 감각입니다.
02 · WEB DATA

인터넷에서 가져온다면: 복사부터 웹 수집까지

작은 양이면 컨트롤 C·V가 가장 빠릅니다. 다만 매일 여러 페이지를 확인하거나 수백 건을 정리해야 한다면, 컴퓨터가 같은 절차를 반복하게 만드는 방법을 고민하게 됩니다.

웹 크롤링(Crawling)

여러 페이지를 따라가며 주소와 내용을 찾아가는 과정입니다. 도서관에서 책 목록을 훑어 어떤 책이 있는지 찾아보는 일에 가깝습니다.

웹 스크래핑(Scraping)

찾아낸 페이지에서 제목, 가격, 댓글처럼 필요한 항목을 뽑아 표로 만드는 과정입니다. 책 한 권에서 필요한 문장만 메모하는 일에 가깝습니다.

실무에서는 두 단어를 섞어 부르기도 합니다. 예를 들어 “인스타그램 댓글을 모으고 싶다”는 일은 페이지를 찾는 단계와 댓글을 추출하는 단계를 모두 포함할 수 있습니다. 파이썬은 이런 반복을 자동화하기 좋지만, 사이트 정책과 기술적 제한 때문에 처음부터 쉬운 일은 아닙니다.

먼저 확인할 것: 로그인 뒤의 정보, 개인정보, 저작권이 있는 콘텐츠를 무단으로 대량 수집하면 안 됩니다. 사이트의 이용약관·robots 안내·API 제공 여부를 확인하고, 서비스에 과도한 요청을 보내지 마세요. 가능하면 공식 API나 제공자의 다운로드 기능을 우선합니다.
03 · EXTERNAL SYSTEM

외부 기관에 요청한다면: API는 ‘정해진 접수 창구’입니다

API(Application Programming Interface)는 이메일이나 전화로 반복 요청하던 일을 시스템끼리 빠르게 주고받기 위한 약속입니다. 상대가 “이 주소로, 이 양식에 맞춰 보내면, 이 형식으로 답하겠다”라고 정해 둔 접수 창구라고 생각하면 이해가 쉽습니다.

API 제공자어떤 데이터를 줄지, 요청 횟수와 인증 방식은 무엇인지 정합니다. 제공자가 정한 범위 밖의 데이터는 받을 수 없습니다.
API 사용자주소(URL), 요청 방식, 필수 항목, 인증키, 결과 형식을 문서대로 맞춥니다.
API 문서두 시스템이 지킬 약속을 적은 안내서입니다. 회사마다 표현과 구조가 달라 처음 읽을 때 어려울 수 있습니다.
현실적인 기대를 세우세요. API가 있다고 해서 원하는 모든 데이터가 열리는 것은 아닙니다. 공공데이터, 지도·검색처럼 제공 범위가 분명한 데이터에 특히 유용하며, 사업상 민감하거나 경쟁력이 큰 데이터는 제공자가 제한하는 경우가 많습니다.
04 · AI CONNECTION

MCP는 AI가 외부 도구와 연결되는 공용 규격입니다

MCP(Model Context Protocol)는 AI 앱이 파일, 데이터베이스, 검색 도구, 업무 서비스와 연결될 수 있게 하는 공개 표준입니다. API를 하나씩 직접 이해하고 연결하는 대신, 이미 준비된 MCP 서버를 AI 도구에 연결해 “드라이브에서 이 파일을 찾아 요약해 줘”처럼 일하게 만들 수 있습니다.

연결 대상사내 파일, 데이터베이스, 검색, 계산, 업무 시스템처럼 AI에게 문맥이나 작업을 제공하는 도구
자주 연결하는 서비스 예Google Drive, Notion, GitHub, Slack 등 팀이 이미 쓰는 정보·협업 도구
반드시 점검할 것읽기만 가능한지, 수정·전송 권한도 있는지, 연결된 계정과 데이터 범위는 적절한지

MCP는 AI 애플리케이션과 외부 시스템을 연결하는 공개 표준입니다. 개념과 보안 고려 사항은 MCP 공식 소개보안 권장 사항을 참고하세요.

PRACTICAL CHECKLIST

그래서 무엇을 먼저 쓰면 될까요?