핵심 요약
- 새 데이터를 받으면 분석보다 먼저 AI에게 “어떻게 생겼는지”를 묻습니다.
- 프롬프트 세 개면 모양, 숫자 범위, 빈칸 개수를 표로 받을 수 있습니다.
- 핵심은 결과에서 현실에 없는 값과 빈칸의 뜻을 사람이 확인하는 것입니다.
오늘의 질문조사 데이터를 새로 받았는데, AI에게 무엇부터 물어봐야 할까?
새 데이터를 받으면 평균이나 그래프보다 데이터 탐색이 먼저입니다. 데이터 탐색은 본 분석 전에 데이터가 어떻게 생겼고 어디에 문제가 숨어 있는지 훑어보는 단계입니다.
이 글에서는 이 연재에서 계속 쓰는 가상의 조사 데이터(조사지 3곳 × 방형구 20곳)로 AI에게 물을 프롬프트 세 개를 차례로 보여 드립니다. 결과 상자의 숫자는 이 데이터로 실제 계산한 값입니다. 프롬프트는 Claude Code, ChatGPT, Claude 채팅 어디에 넣어도 됩니다. Claude Code라면 파일을 작업 폴더에 두고, 채팅이라면 파일을 첨부한 뒤 붙여 넣습니다.
연재AI와 함께하는 연구 데이터 분석
- 시작 전에: 연구자의 AI 작업실 만들기 설치·준비 4편
- 1편. AI 데이터 분석, 무엇을 맡길까
- 2편. 데이터 탐색, AI에게 먼저 물을 것 지금 읽는 글
- 3편. 그룹별 비교와 상관관계 묻기
- 4편. ChatGPT로 CSV 그래프 그리기
- 5편. 결측치 처리: 지울까, 채울까
- 6편. 분석 전 데이터 정리 맡기기 준비 중
- 7편. 이상한 값과 입력 실수 찾기 준비 중
- 8편. 숫자 예측 모델, AI로 돌리기 준비 중
데이터 탐색은 택배 검수입니다
장비 상자가 오면 바로 쓰지 않고 구성품부터 확인합니다. 개수가 맞는지, 망가진 부품은 없는지 봅니다. 데이터 탐색도 같습니다. 분석에 쓰기 전에 받기로 한 것이 제대로 왔는지 검수하는 단계입니다.
미국 국립표준기술연구소(NIST)의 통계 핸드북과 IBM의 설명 모두 이 단계의 목적으로 튀는 값과 이상한 점을 찾는 일을 꼽습니다. 사람이 60줄을 눈으로 훑는 대신 AI에게 요약을 부탁하면 몇 분이면 끝납니다.
AI에게 데이터 탐색 맡기기 3단계
1. 모양과 열 뜻 묻기
이렇게 요청합니다
quadrat_survey.csv 파일을 살펴봐 줘.
행과 열이 몇 개인지 먼저 알려 주고,
열마다 뜻, 종류(숫자 또는 글자), 빈칸 수를 표로 정리해 줘.
이렇게 나옵니다
행 60개, 열 14개
| 열 (뜻) | 종류 | 빈칸 |
|---|---|---|
| 방형구 번호 | 글자 | 0 |
| 조사지 | 글자 | 0 |
| 조사 날짜 | 글자 | 0 |
| 고도 (m) | 숫자 | 0 |
| 경사 (도) | 숫자 | 0 |
| 토양 pH | 숫자 | 4 |
| 토양 수분 (%) | 숫자 | 2 |
| 훼손 정도 | 글자 | 0 |
| 토양 유형 | 글자 | 0 |
| 전체 피도 (%) | 숫자 | 0 |
| 종 수 | 숫자 | 0 |
| 종 A 출현 (0/1) | 숫자 | 0 |
| 종 A 피도 (%) | 숫자 | 2 |
| 바이오매스 (g/m²) | 숫자 | 1 |
행 60개는 조사지 3곳 × 20곳과 맞습니다. 파일의 열 이름은 soil_ph 같은 영어 약자라서 뜻을 함께 정리해 달라고 했습니다. 빈칸은 토양 pH 4칸, 토양 수분 2칸, 종 A 피도 2칸, 바이오매스 1칸입니다.
생각해 볼 점
- 행 수가 조사 계획과 같은지 먼저 봅니다. 다르면 빈 줄이나 두 줄짜리 머리글이 섞였을 수 있습니다.
- 숫자여야 할 열이 “글자”로 나오면, 그 열에 숫자가 아닌 값이 섞여 있다는 신호입니다.
2. 숫자 범위 묻기
이렇게 요청합니다
숫자 열마다 최솟값, 평균, 최댓값을 표로 보여 줘.
현실에서 나올 수 없는 값이 있으면 어느 방형구인지 따로 알려 줘.
이렇게 나옵니다
| 변수 | 최솟값 | 평균 | 최댓값 |
|---|---|---|---|
| 고도 (m) | 57.0 | 489.3 | 932.0 |
| 경사 (도) | 0.9 | 12.7 | 34.7 |
| 토양 pH | 4.1 | 6.4 | 58.3 |
| 토양 수분 (%) | 14.9 | 32.5 | 49.3 |
| 전체 피도 (%) | 37.0 | 68.3 | 98.0 |
| 종 수 | 4.0 | 8.7 | 15.0 |
| 바이오매스 (g/m²) | 110.8 | 239.3 | 377.3 |
| 방형구 | 조사지 | 토양 pH |
|---|---|---|
| C08 | C | 58.3 |
토양 pH 최댓값이 58.3입니다. pH는 0에서 14 사이의 값이라서(미국 지질조사국, 미국 환경보호청) 현실에서 나올 수 없습니다. 소수점을 한 칸 밀어 5.83을 잘못 적은 것으로 보입니다.
생각해 볼 점
- 값을 고칠지 뺄지는 AI가 아니라 원자료(야장)를 보고 사람이 정합니다.
- 이 한 값 때문에 토양 pH 평균(6.4)이 실제보다 높게 나옵니다. 고치기 전의 평균은 쓰지 않습니다.
3. 빈칸과 조사지별 개수 묻기
이렇게 요청합니다
빈칸이 있는 열과 빈칸 수를 표로 보여 줘.
그리고 조사지별로 훼손 정도(없음, 약함, 강함)에 따라 방형구가 몇 곳인지 표로 세어 줘.
이렇게 나옵니다
| 빈칸이 있는 열 | 빈칸 수 |
|---|---|
| 토양 pH | 4 |
| 토양 수분 (%) | 2 |
| 종 A 피도 (%) | 2 |
| 바이오매스 (g/m²) | 1 |
| 조사지 | 없음 | 약함 | 강함 | 합계 |
|---|---|---|---|---|
| A | 11 | 7 | 2 | 20 |
| B | 8 | 11 | 1 | 20 |
| C | 13 | 4 | 3 | 20 |
조사지마다 20곳씩이고, 훼손 정도는 조사지별로 고르게 나뉘지 않았습니다.
생각해 볼 점
- 종 A 피도 빈칸 2칸은 종 A가 “있었다”고 적힌 방형구입니다. 0(없음)이 아니라 모르는 값이라서 0으로 채우면 안 됩니다.
- 훼손이 강한 곳은 세 조사지를 합쳐 6곳뿐입니다. 이 그룹끼리 비교한 결과는 조심해서 읽어야 합니다.
결과가 다르게 나오면 이렇게 묻습니다
AI의 답은 매번 표현이 다릅니다. 그래도 숫자는 위 결과 상자와 같아야 합니다. 다르면 아래처럼 되묻습니다.
| 이런 결과가 나오면 | 이렇게 다시 묻기 |
|---|---|
| 행 수가 60개가 아님 | “머리글이 몇 줄인지, 빈 줄이 섞였는지 확인해 줘” |
| 빈칸 수가 다름 | “빈칸을 어떤 기준으로 셌는지 알려 줘” |
| 이상한 값을 못 찾음 | “열마다 현실적인 범위를 먼저 정하고, 벗어난 값을 찾아 줘” |
정리
데이터 탐색은 AI에게 모양, 숫자 범위, 빈칸을 차례로 묻는 것으로 충분합니다. 이 데이터에서는 토양 pH 58.3 하나와 빈칸 9칸이 드러났습니다. 다음 단계로 가기 전에 이 둘을 어떻게 다룰지 메모해 두는 것이 좋습니다.
다음 편 예고그룹별 비교와 상관관계 묻기: 조사지마다 평균이 어떻게 다른지, 두 변수가 함께 움직이는지 AI에게 묻는 법을 다룹니다.
출처
- NIST/SEMATECH e-Handbook of Statistical Methods, “What is EDA?”
- IBM, “What is exploratory data analysis?”
- 미국 지질조사국(USGS) Water Science School, “pH and Water”
- 미국 환경보호청(EPA) CADDIS, “pH”