(번역) AI 가 우리에게 다가오고 있다

이 글은 AI가 데이터베이스에 직접 접근해 인간 전문가처럼 데이터를 분석하는 새로운 워크플로우를 소개합니다. 단순한 질의응답을 뛰어넘는 이러한 도약은 데이터 분석가의 역할이 근본적으로 재정의될 미래를 암시합니다.

들어가기에 앞서

아래의 번역된 글은 원문의 저자에게 번역 및 게재 허락은 받았습니다.
원문: Small Data and self service - AI is coming for us

using-mcp

살다보면 이전의 상태로 돌아갈 수는 없겠다 싶은 순간들이 생기기 마련입니다. 저는 10년 전 Gary 가 제게 PowerPivot 을 알려줬던 게 특히 기억에 남고, 데이터를 다루는 게 엑셀을 가지고 노는 것만큼 쉬워지는 날이 올 것이라고 생각했습니다. 또 다른 순간은 이틀 전 제가 Claude Desktop 을 데이터베이스에 연결한 뒤, “너는 뭐라고 생각해?” 라는 질문을 던졌을 때였습니다.

이건 아주 낯선 경험이었습니다. 기존에 겪었던 “데이터를 살펴보고 멋진 차트를 그려줘” 와 같은 게 아니었으니까요. 오히려 사람과 이야기를 나누고 나서 보고서 작성을 요청하는 것 같았습니다. LLM 이 모든 테이블을 나열하더니, 데이터를 살펴보고, 각 데이터셋이 어떤 것인지도 알아냈습니다. 어떤 방식을 썼는지는 모르겠지만, 전력 생산과 관련된 숫자가 MW 단위인 걸 알아냈습니다. 이를 MWh 로 변환하기 위해서는 12로 나눠줘야 합니다.

이런 방식이 전형적인 데이터와 대화를 나누는 워크플로우 (chat with your data workflow) 에 비해 강력한 이유는 단순합니다. LLM 이 데이터에 대한 읽기 권한을 가지고 있기 때문입니다. 이는 여전히 안전하고, 당신이 부여한 접근 대상을 읽을 수만 있습니다. 제가 알기로는, 이러한 LLM 들은 자가 학습을 하거나, 데이터를 학습에 사용하지는 않습니다. 적어도 엔터프라이즈 API 를 사용한다면 말이죠.

또 흥미로운 것이 있었습니다. 비개발자로서 저는 코딩 분야에 있어서 AI 의 진보를 매우 흥미롭게 지켜봤으며, 개발자들에게 크게 공감을 느끼지는 않았습니다. 저는 그들이 위협을 과장하는 줄 알았습니다. 그런데 AI 가 분석 또한 잘 하게 될 것이라는 걸 보고 난 뒤 마음이 바뀌었습니다.

Note: 앞으로는 LLM 을 AI 라고 하겠습니다. Kurt 의 블로그를 한 번 읽어봐주시고, MCP 에 대해 알려준 Pawel 에게도 감사하다는 말씀을 드립니다.

일반적인 “데이터로 채팅하기” 워크플로우

chat-with-your-data-workflow

여기서 중요한 부분은 AI 는 여러분의 데이터에 접근 권한이 없다는 것입니다. 여러분은 데이터에 대해 최대한 많은 정보를 모아서, 이 정보와 함께 질문을 AI 에게 보냅니다. 그러면 AI 는 SQL 이나 DAX 를 생성해서 보내주고, 사용자는 이를 자신의 서버에 직접 실행하여 답변을 얻습니다. 만약 질문이 충분히 명확하지 않았다면, 이를 명확하게 하기 위한 질문을 다시 합니다. 예를 들면, ‘세계에서 가장 큰 나라가 어디냐’ 는 질문은 했다면, AI 는 영토를 기준으로 하는 것인지, GDP 를 기준으로 하는 것인지 등을 되물을 것입니다. 실제로는 훨씬 더 복잡하긴 하겠지만, 핵심 아이디어는 이렇습니다.

기본적으로 우리는 AI 가 우리의 데이터를 볼 수 없게 하기 위해 많은 노력을 들입니다. 가끔은 쓰다 보면 왜 이렇게 명백한 질문에도 제대로 답변을 못하는지 의문을 가지기도 할 겁니다. 생각해보세요. 다른 사람이 데이터 분석가인 여러분에게 아무런 숫자를 보지 않고 보고서를 작성하달라고 하면 어떨 것 같나요?

MCP 를 사용했을 때

using-mcp

이 환경에서 AI 는 고삐가 풀린 상태입니다. 데이터를 직접 읽을 수 있고 (다시 말씀드리지만, 여러분이 부여한 데이터에 대해, 이상적으로는 읽기 권한만 가지고 있습니다), 쉽게 말해서 대리인의 역할을 하면서, 더 많은 자율성을 가지고 있습니다. 그리고 메타데이터에 제한된 것도 아닙니다.

OneLake 의 데이터를 사용하는 사례

OneLake 는 Microsoft 의 Data Lake 관련 제품입니다
Microsoft - OneLake

제 OneLake 에는 아래와 같은 데이터가 있는데, 이는 모두 정제된 데이터입니다.

onelake-tables

아직 Fabric 데이터웨어하우스를 위한 MCP 서버가 없어서, DuckDB MCP 서버 를 사용하여 OneLake 에서 데이터를 읽어왔습니다. 편의를 위해 직접 쿼리를 사용하지 않고, 데이터를 로컬 DuckDB 파일로 저장했습니다.

import duckdb
 
con = duckdb.connect()
con.sql("ATTACH 'aemo_delta.duckdb' AS db; USE db")
 
for tbl in ['duid', 'summary', 'calendar', 'mstdatetime']:
    con.sql(f"""
        CREATE OR REPLACE TABLE {tbl} AS 
        FROM delta_scan('abfss://serving@onelake.dfs.fabric.microsoft.com/datamart.Lakehouse/Tables/aemo/{tbl}')
    """)
 
con.close()

MCP 를 설치하고, Claude Desktop 과 연결 설정을 마쳐야 합니다. 명확히 하자면, 모든 MCP 클라이언트와 사용할 수 있지만, 제가 찾을 수 있는 것들 중 가장 괜찮았던 것이 이것이었습니다. 언젠가는 Power BI Desktop 이 MCP 클라이언트가 될지 누가 알겠어요 (완전히 만들어낸 이야기입니다. 힌트 같은 게 아니에요).

그런 뒤 Claude Desktop 에 아래 설정을 추가해줍니다.

{
  "mcpServers": {
    "mcp-server-motherduck": {
      "command": "uvx",
      "args": [
        "mcp-server-motherduck",
        "--db-path",
        "/tmp/llm/aemo_delta.duckdb"
      ]
    }
  }
}

제가 느끼기에는 AI 를 위한 OBDC 같았습니다. 모든 사람들이 이 프로토콜을 사용하고 있으니까요.

경험

데이터도 공개되어 있어서 전체 채팅 기록도 공개하겠습니다. 저는 AI 가 문제에 접근한 방식이 매우 마음에 들었는데, 첫 번째로 테이블을 확인한 것이었습니다. 이는 매우 사람 같은 행동이라고 생각합니다.

analyse-the-data-in-duckdb-and-give-me-key-insights

채팅을 읽어보시면, 완벽하지는 않다는 것을 알 수 있을 겁니다. 재생에너지에 대해 이야기하면서 수력 발전을 생략하기도 하고, 전날에는 맞게 계산했지만 MWh 를 잘못 계산하기도 했습니다.

key-revelations

발견한 것들

간단하게 사용하려고 해도 여전히 시멘틱 모델 (semantic model) 이 필요합니다. 만약에 제가 MWh = MW/12 로 측정했었다면 AI 는 항상 그렇게 했을 것입니다. 적어도 이론적으론 말이죠. 복잡한 모델에 있어서는 더욱 중요합니다. 말이 나와서 하는 말인데, AI 는 모델링 또한 잘 합니다. 이제 인간이 필요할까요?
놀랍게도 이 단순한 워크플로우에서 모든 연산을 변경할 수 있습니다. 진짜로 중요한 것은 스토리지입니다!
제가 사용한 모든 데이터는 공개되어 있기 때문에 보안에 주의하지 않아도 되었습니다. 기업에서 사용하는 것이라면 Claude Desktop 같은 도구를 사용할 수 없을 것이고, Azure AI Foundry 같은 솔루션을 고려해볼 수 있을 것입니다.
지금까지 대부분의 모델은 서빙 단계에서는 추가적인 지식을 습득하지 못하고 있지만, 향후 10년 동안 어떻게 바뀔지 누가 알겠어요? 사용자, 그리고 데이터와 상호작용을 하면서 학습하는 AI 를 상상해보세요. 완전히 새로운 질문들을 하게 될 겁니다. 사용자 마다 특정한 모델이 필요한가요? 아직 그 단계는 아니지만, 언젠가는 해결해야할 문제라고 생각합니다.
절대 MCP 에게 그 어떤 쓰기 권한도 주지 마세요.

2025 9
2023 5
2022 1
2020 7
2019 24

2025

실험 기간을 좀 더 늘리면 안 돼요?

4 minute read

실험을 한 번 진행했는데 통계적으로 유의하지 못한 결과를 얻었습니다. 기간을 조금 더 두고 실험을 하자니 시간이 오래 걸릴 것 같은데 기존 결과를 그대로 포함해서 실험 기간을 늘려서 보면 안 되나요?

A/B 테스트가 통계학을 망치고 있다

2 minute read

A/B 테스트란 무엇이고, 제가 왜 이게 통계학을 망치고 있다고 생각하는지 설명드리고자 합니다.

(번역) AI 가 우리에게 다가오고 있다

5 minute read

(번역) 넷플릭스 게임 사용자의 모험

2 minute read

이 글은 넷플릭스 (Netflix) 에서의 분석 엔지니어링 (Analytics Engineering) 관련 업무의 범위를 공유하기 위한 여러 편의 글 중 두 번째 글이며, 최근에 열렸던 분석 엔지니어링 컨퍼런스에서 발표된 내용이기도 합니다. 더 많은 내용이 궁금하신가요? 첫 번째 ...

(번역) 듀오링고의 그로스 모델에 대한 오해

4 minute read

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 3

10 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델 들어가기에 앞서

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 2

7 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델 들어가기에 앞서

(번역) 듀오링고가 사용자의 성장에 다시금 불을 지핀 방법 - Part 1

8 minute read

듀오링고의 350% 성장의 뒷 이야기, 리더보드, 연속 학습, 알림, 그리고 혁신적인 그로스 모델

(번역) 의미있는 지표 (데이터로 제품팀이 집중해야할 것을 뾰족하게 만든 방법)

10 minute read

원문: Meaningful metrics: How data sharpened the focus of product teams

2023

(번역) Booking.com 에서의 축차 검정 (Sequential Testing)

19 minute read

원문: Sequential Testing at Booking.com

영어랑 친해지는 방법

7 minute read

가장 좋은 방법은 당연히 영어 밖에 사용하지 못하는 환경에 강제로 처해지는 것이겠지만 그것이 어려우니…

신입 데이터 분석가를 꿈꾸는 분들에게

3 minute read

고민의 흔적을 보여주세요

데이터 트래킹 기깔나게 잘 하는 방법

4 minute read

을 찾습니다.

(번역) Testing Product Ideas Handbook

6 minute read

소개

2022

(번역) 차트와 접근성

4 minute read

원문: Charts & Accessibility

2020

모수, 큰 수의 법칙, 그리고 중심극한정리

3 minute read

모수, 큰 수의 법칙, 그리고 중심극한정리에 대하여

(번역) 내가 COVID-19 데이터를 시각화하지 않는 이유

12 minute read

그리고 여러분들도 (아마도) 하지 않아야 하는 이유

사내 스터디에 대한 회고

2 minute read

회사 서비스의 추천 시스템을 개선하기 위해 팀 내에서 (아직까진 두 명이긴 하지만) 지난 두 달 동안 스터디를 진행했습니다. 얼마 전 두 번째 스터디가 끝났고 이에 대한 회고를 해보려고 합니다.

(번역) 데이터의 어두운 면 - 개인정보 (Dark Side of Data:Privacy)

6 minute read

원문: Dark Side of Data: Privacy by Emre Rencberoglu

(번역) 초보자를 위한 RStudio 의 프로젝트 와 작업 디렉토리

9 minute read

원문: RStudio Projects and Working Directories: A Beginner’s Guide by Martin Chan

(번역) Tidy Tuesday 이벤트에 대한 소개

3 minute read

원문: TidyTuesday GitHub Repository

(번역) 프로그래밍 언어들의 이름을 지은 방법

4 minute read

1 minute read

이 자료는 데이터 과학과 관련된 특정 주제에 대한 연재물이며, 다룰 주제는 다음과 같다. 회귀분석, 군집화, 신경망, 딥러닝, 의사결정나무, 앙상블, 상관관계, 파이썬, R, 텐서플로우, SVM, 데이터 축소, 피쳐 선택, 실험 계획법, 교차검증, 모델 피팅 등. 이 글을 계속 받...