같은 USB 허브가 CSV 안에서 USB 허브, usb허브, USB 허브로 적혀 있다면 합계표에서는 서로 다른 상품처럼 보일 수 있습니다. 이때 “공백을 전부 지워 줘”라고만 요청하면 더 큰 문제가 생깁니다. 원래 다른 이름까지 합쳐질 수 있고, 무엇을 왜 바꿨는지 확인하기 어려워지기 때문입니다.
- 원본 상품명 열은 그대로 둡니다. 새 열
product_name_standard에 통일된 이름을 적습니다. - 먼저 기준 이름을 정한 매핑표를 만들고, 그 표에 있는 값만 바꿉니다.
- 공백·영문 대소문자·괄호 폭처럼 확인 가능한 표기만 고칩니다. 뜻이 같은지 불분명하면 합치지 않습니다.
- 마지막에는 원본과 정리본의 행 수 12, quantity 합계 19가 같은지 확인합니다.
이 글은 실제 쇼핑몰 자료가 아닌 자체 제작 12행 CSV를 사용합니다. 파일을 내려받아 그대로 따라 하면 상품명 12개가 표준 이름 4개로 정리되는 과정을 재현할 수 있습니다. 단, 행은 합치거나 지우지 않으며 원래 상품명과 상품코드도 보존합니다.
이 실습이 필요한 사람
- 같은 상품인데 띄어쓰기 차이 때문에 목록이 여러 줄로 갈라지는 사람
- CSV를 정리해 달라고 요청했지만 어떤 값이 바뀌었는지 확인하기 어려웠던 사람
- ChatGPT가 만든 정리본을 바로 쓰지 않고 행 수와 수량으로 검산하고 싶은 입문자
- 엑셀 함수나 코드를 배우기 전에 작은 파일로 데이터 정리 원칙부터 익히고 싶은 사람
상품명 표기 통일이란?
표기 통일은 같은 대상을 가리키는 값들을 미리 정한 한 가지 이름으로 맞추는 작업입니다. 이 글의 예에서는 usb허브와 USB 허브를 USB 허브로 바꿉니다. 중요한 점은 비슷해 보이는 문자열을 자동으로 한데 모으는 일과 다르다는 것입니다.
예를 들어 USB 허브와 USB 허브 Pro는 실제로 다른 상품일 수 있습니다. 문자 몇 개가 비슷하다는 이유만으로 합치면 판매 수량과 재고가 틀어집니다. 그래서 안전한 순서는 “비슷한 값 찾기 → 사람이 기준 이름 확정 → 기준표에 있는 값만 새 열에 기록”입니다.
원본 열을 덮어쓰면 안 되는 이유
정리 결과가 틀렸을 때 원본이 남아 있어야 다시 비교할 수 있습니다. OpenAI의 데이터 정리 사용 사례도 지저분한 CSV나 스프레드시트를 첨부하고 문제를 설명한 뒤, 원본은 바꾸지 않은 정리 사본을 요청하는 흐름을 안내합니다. 가능한 경우 원본 행 ID를 유지하고, 바뀐 행과 확신이 낮은 행을 데이터 품질 메모로 남기는 방법도 제시합니다.
이 실습에서는 세 열을 함께 둡니다.
row_id: R01부터 R12까지 원본 행을 찾는 번호product_name_original: 처음 파일에 있던 상품명product_name_standard: 기준표에 따라 통일한 상품명
이렇게 하면 “R12의 전각 괄호를 반각 괄호로 바꿨다”처럼 변경 이유를 행 단위로 설명할 수 있습니다.
따라 하기에 쓸 파일
정답부터 보지 말고 원본 → 빈 판정표 → 질문문 → 정답 → 정리본 순서로 사용하세요. 모든 파일은 실제 개인정보나 회사 자료가 없는 자체 제작 자료입니다.
- 상품명 12행 원본 CSV 내려받기
- 직접 채우는 빈 판정표 CSV 내려받기
- 복사용 질문문 TXT 내려받기
- 행별 정답 CSV 내려받기
- 원본과 표준 이름을 함께 둔 정리본 CSV 내려받기
원본 12행 먼저 살펴보기
| 행 | 상품코드 | 원본 상품명 | 수량 |
|---|---|---|---|
| R01 | P-101 | USB 허브 | 2 |
| R02 | P-102 | usb허브 | 1 |
| R03 | P-103 | USB 허브 | 3 |
| R04 | P-104 | 무선 마우스 | 1 |
| R05 | P-105 | 무선마우스 | 2 |
| R06 | P-106 | 무선 마우스[끝 공백] | 1 |
| R07 | P-107 | 노트북 거치대 | 2 |
| R08 | P-108 | 노트북거치대 | 1 |
| R09 | P-109 | 노트북 거치대 | 2 |
| R10 | P-110 | 웹캠 (HD) | 1 |
| R11 | P-111 | 웹캠(HD) | 2 |
| R12 | P-112 | 웹캠(HD) | 1 |
이 표에는 상품 네 종류가 각 세 번씩 등장합니다. 그러나 원본 문자열만 세면 열두 값 가운데 여러 값이 서로 다르게 보입니다. 시작 전에 원본 행 수 12와 quantity 합계 19를 메모해 두세요. 이것이 정리 뒤 비교할 기준입니다.
기준표를 먼저 만들기
| 표준 이름 | 통일할 원본 표기 | 확인할 규칙 |
|---|---|---|
| USB 허브 | USB 허브 / usb허브 / USB 허브 | USB 대문자, 단어 사이 한 칸 |
| 무선 마우스 | 무선 마우스 / 무선마우스 / 끝 공백 포함 | 단어 사이 한 칸, 끝 공백 제거 |
| 노트북 거치대 | 노트북 거치대 / 노트북거치대 / 연속 공백 | 단어 사이 한 칸 |
| 웹캠(HD) | 웹캠 (HD) / 웹캠(HD) / 웹캠(HD) | 괄호 앞 공백 제거, 반각 괄호 |
기준표가 중요한 이유는 ChatGPT가 “비슷해 보인다”는 이유로 임의 판단하는 범위를 줄여 주기 때문입니다. 실제 업무에서는 상품 담당자나 상품 마스터 파일의 이름을 기준으로 삼으세요. 가능하면 상품명보다 변하지 않는 상품코드를 기준으로 연결하는 편이 더 안전합니다. 두 파일을 상품코드로 연결하려면 두 CSV 합치기 실습을 참고할 수 있습니다.
상품명 표기 통일 6단계

1단계. 원본 파일을 복사하고 행 식별자 확인하기
원본 CSV를 별도 보관하고 작업 사본을 만듭니다. row_id가 없다면 R01, R02처럼 임시 식별자를 추가해도 좋습니다. 중요한 것은 정리 전후에 같은 행을 다시 찾을 수 있게 만드는 것입니다. 상품코드와 수량처럼 바꾸지 않을 열도 함께 지정합니다.
2단계. 서로 다른 표기만 목록으로 뽑기
바로 치환하지 말고 product_name의 고유값과 개수를 먼저 요청합니다. 앞뒤 공백, 연속 공백, 영문 대소문자, 반각·전각 괄호 차이를 표시하도록 합니다. 이 목록을 보면 단순 표기 차이와 실제 다른 상품 후보를 나눌 수 있습니다.
3단계. 사람이 표준 이름과 매핑을 확정하기
“이 값들은 같은 상품이다”라는 판단은 데이터에 없는 업무 지식일 수 있습니다. 이 글에서는 학습용 기준표가 이미 정답 역할을 하지만, 실제 자료에서는 상품 담당자가 확인한 마스터 이름을 사용하세요. 확정되지 않은 값은 needs_human_review=YES로 남깁니다.
4단계. 원본 옆에 새 표준 열 만들기
product_name_original을 그대로 두고 product_name_standard를 새로 만듭니다. applied_rule에는 “끝 공백 제거”, “전각 괄호를 반각으로”처럼 바꾼 이유를 적습니다. 기준표에 없는 값은 원본을 유지하고 검토 표시를 남깁니다.
5단계. 미리보기에서 행별로 대조하기
정리본 전체를 한꺼번에 믿지 말고, 각 표준 이름에서 한 행 이상을 원본과 비교합니다. OpenAI의 파일 작업 안내처럼 생성된 파일을 미리 보거나 내려받은 뒤, 수정할 표·열과 그대로 둘 부분을 구체적으로 알려 다시 요청할 수 있습니다. 파일 미리보기 위치가 낯설다면 생성 파일 미리보기·수정·다운로드 6단계를 먼저 보세요.
6단계. 행 수와 숫자 합계로 검산하기
표기 통일은 이름 열만 바꾸는 작업이므로 행 수와 quantity 합계는 달라지면 안 됩니다. 이 실습의 성공값은 원본 12행·합계 19, 정리본 12행·합계 19입니다. 표준 이름의 고유값은 4개이며 각 이름은 3행입니다.
복사해서 쓸 질문문
첨부한 csv-product-name-source.csv를 읽어 주세요. 목표: - row_id, product_code, quantity와 원본 product_name은 바꾸지 않습니다. - 새 열 product_name_standard와 applied_rule을 만듭니다. - 제공한 기준표의 네 상품만 표기를 통일합니다. 출력: 1. 전체 12행을 유지한 표 2. 원본 이름, 표준 이름, 적용 규칙 3. 표준 상품명 4개와 각 행 수 4. 원본과 정리본의 행 수·quantity 합계 비교 경계: - 기준표에 없는 이름은 임의로 합치지 말고 needs_human_review=YES로 표시하세요. - 원본 열을 덮어쓰거나 행을 삭제하지 마세요. - 마지막에 12행 유지, quantity 합계 19 유지, 표준 이름 4개인지 확인하세요.
이 질문문은 목표, 입력 맥락, 결과 형식, 바꾸지 말아야 할 경계, 마지막 확인 기준을 나눠 적었습니다. OpenAI의 프롬프팅 안내도 큰 작업에서는 목표·맥락·결과·경계를 분명히 하고, 스프레드시트를 변환하는 작업이라면 파일을 함께 제공하는 방식을 설명합니다.
정답 확인: 12행이 네 이름으로 정리됩니다
| 표준 상품명 | 행 | 행 수 | 수량 합계 |
|---|---|---|---|
| USB 허브 | R01·R02·R03 | 3 | 6 |
| 무선 마우스 | R04·R05·R06 | 3 | 4 |
| 노트북 거치대 | R07·R08·R09 | 3 | 5 |
| 웹캠(HD) | R10·R11·R12 | 3 | 4 |
| 전체 | R01~R12 | 12 | 19 |
R01, R04, R07, R11처럼 이미 기준 표기와 같은 행도 삭제하지 않습니다. applied_rule에 “기준 표기와 일치”라고 남깁니다. 이것은 변환 대상만 보여 주는 표보다 전체 12행을 다시 대조하기 쉽게 만듭니다.
성공 기준 체크리스트
- 원본 CSV와 정리본 CSV가 별도 파일로 남아 있습니다.
- R01부터 R12까지 모든
row_id가 한 번씩 있습니다. - 원본
product_name, 상품코드, quantity를 덮어쓰지 않았습니다. - 표준 이름은 USB 허브·무선 마우스·노트북 거치대·웹캠(HD) 네 개입니다.
- 원본과 정리본이 모두 12행이고 quantity 합계가 19입니다.
- 기준표 밖의 모호한 이름은 임의로 합치지 않고 사람 확인 대상으로 남깁니다.
실패 화면: 모든 공백을 지웠을 때

“모든 상품명의 공백을 지워 줘”는 규칙이 단순해 보이지만 안전하지 않습니다. USB 허브 Pro와 다른 모델명이 섞여 있다면 의미 있는 구분까지 사라질 수 있습니다. 또한 원본 열을 바로 바꾸면 잘못된 치환을 찾았을 때 되돌리기 어렵습니다.
수정 질문은 “기준표의 네 이름만 새 열에 기록하고, 기준표 밖 값은 needs_human_review=YES로 남겨 달라”고 해야 합니다. 여기에 원본 열 보존과 행 수·수량 합계 검산을 추가하면 결과를 판정할 기준이 생깁니다.
자주 실패하는 5가지 경우와 수정법
1. 앞뒤 공백이 화면에서 보이지 않습니다
R06처럼 끝에 붙은 공백은 표에서 쉽게 놓칩니다. 고유값을 보여 달라고 할 때 값의 시작과 끝을 대괄호로 감싸거나 문자열 길이를 함께 표시해 달라고 요청하세요. 예: [무선 마우스 ] / 길이 7. 단, 실제 길이는 사용하는 도구의 문자 계산 방식에 따라 표시가 다를 수 있으므로 원본 파일도 함께 봅니다.
2. 영문을 모두 대문자나 소문자로 바꿉니다
USB처럼 대문자가 기준인 약어가 있는 반면, 제품명에는 브랜드가 정한 대소문자가 있을 수 있습니다. 전역 규칙을 쓰지 말고 상품 마스터의 기준 이름을 매핑표에 적으세요. 기준을 모르면 원본을 유지하고 검토 대상으로 남깁니다.
3. 괄호 속 옵션까지 지워 버립니다
이 실습은 전각 괄호 ( )를 반각 ( )으로 바꾸고 괄호 앞 공백만 정리합니다. HD 자체는 옵션 정보이므로 삭제하지 않습니다. 괄호 안 내용을 없애 달라는 요청은 서로 다른 모델을 합칠 위험이 있습니다.
4. 행을 합치면서 수량도 달라집니다
상품명 표기 통일과 상품별 집계는 다른 단계입니다. 먼저 12행을 그대로 둔 정리본을 완성하고 검산한 다음, 별도 사본에서 표준 이름별 수량을 집계하세요. 한 번에 정리와 집계를 요청하면 어느 단계에서 행이 줄었는지 찾기 어렵습니다.
5. 숫자 열이 문자로 읽혀 합계가 0이 됩니다
상품명은 정상적으로 정리됐는데 수량이나 금액 합계가 이상하다면 숫자 열의 쉼표·원·공백을 확인해야 합니다. 이 문제는 CSV 문자형 숫자 정리 실습에서 별도로 다룹니다. 상품명 규칙과 숫자 변환 규칙을 한 번에 섞기보다 두 단계로 나누세요.
날짜 표기 통일과 무엇이 다른가요?
날짜는 입력 형식과 목표 형식이 확정되면 비교적 일관된 변환 규칙을 적용할 수 있습니다. 상품명은 단순한 문자열 규칙만으로 같은 상품인지 확정하기 어려운 경우가 많습니다. 따라서 혼합 날짜 표기 통일 실습에서는 날짜 해석 규칙이 중심이고, 이번 글에서는 사람이 확정한 기준표가 중심입니다.
실제 자료에 적용할 때 추가할 열
product_name_original: 원본 이름product_name_standard: 확정한 표준 이름applied_rule: 공백, 대소문자, 괄호, 매핑표 등 변경 이유confidence: 확신 높음·중간·낮음 또는 업무에서 정한 등급needs_human_review: 사람이 확인해야 하면 YESreviewer_note: 기준 이름을 확정한 사람과 근거
이 열들은 결과를 더 화려하게 만들기 위한 것이 아니라, 바뀐 값을 되짚기 위한 기록입니다. 파일에 개인정보나 회사 기밀이 있다면 업로드 전에 제거하거나 가명화하고, 조직의 데이터 처리 정책과 계정 설정을 먼저 확인하세요.
FAQ
상품명이 비슷하면 ChatGPT가 자동으로 같은 상품인지 알 수 있나요?
문자 모양만으로는 확정할 수 없습니다. 모델명, 용량, 색상, 세대처럼 작은 차이가 실제 다른 상품일 수 있습니다. 상품코드나 공식 상품 마스터를 기준으로 확인하고, 근거가 없으면 합치지 마세요.
원본 열 대신 바로 수정한 파일만 받아도 되나요?
연습 단계에서는 권하지 않습니다. 원본과 표준 이름을 나란히 둔 사본이 있어야 변경을 검토하고 잘못된 값을 복구할 수 있습니다. 검수가 끝난 뒤 필요한 시스템 형식으로 내보내더라도 원본과 검수 기록은 별도로 보관하세요.
표준 이름별 수량 합계도 동시에 요청해도 되나요?
가능하지만 처음에는 두 단계가 안전합니다. 먼저 12행 정리본을 검산하고, 그다음 표준 이름별 수량 합계표를 새 출력으로 요청하세요. 이번 정답에서는 USB 허브 6, 무선 마우스 4, 노트북 거치대 5, 웹캠(HD) 4로 전체 19입니다.
CSV가 깨져 보이면 어떻게 하나요?
한글이 깨진다면 UTF-8 인코딩으로 다시 열어 보세요. 이 글의 CSV는 스프레드시트 호환을 위해 UTF-8 BOM으로 저장했습니다. 쉼표가 열로 나뉘지 않으면 가져오기 기능에서 구분 기호를 쉼표로 지정합니다.
몇 행부터 자동화할 가치가 있나요?
정해진 절대 기준은 없습니다. 12행이라도 반복 작업이면 기준표가 유용하고, 수천 행이라도 기준 이름이 확정되지 않았다면 먼저 표본을 검토해야 합니다. 행 수보다 “같은 규칙을 반복할 수 있는가”와 “결과를 검산할 기준이 있는가”가 더 중요합니다.
이 설명이 다루지 않는 것
이 글은 2026년 8월 24일 확인한 OpenAI 공식 문서를 바탕으로 작성했습니다. ChatGPT의 파일 첨부, 미리보기, 다운로드 화면과 제공 범위는 계정·작업공간·앱 버전에 따라 달라질 수 있습니다. 본문의 교육 이미지는 실제 ChatGPT 화면을 캡처한 것이 아니라 데이터 정리 원칙을 설명하기 위해 자체 제작한 화면입니다.
실습의 12행은 표기 차이만 있도록 설계한 가상 자료이므로 정답이 하나로 고정됩니다. 실제 상품 데이터에서는 오탈자처럼 보여도 다른 상품일 수 있습니다. 따라서 기준표 밖 이름, 상품코드 충돌, 빈 값, 삭제 요청은 자동 판단하지 말고 담당자가 확인해야 합니다.
공식 출처와 검증 방법
- OpenAI ChatGPT Learn: Clean up messy data — 원본을 유지한 정리본, 행 ID 보존, 데이터 품질 메모와 결과 검토 확인
- OpenAI ChatGPT Learn: Prompting — 목표·맥락·결과·경계와 파일 첨부를 포함한 질문 구성 확인
- OpenAI ChatGPT Learn: Work with files — 생성 파일 미리보기·다운로드·수정 요청 방법 확인
편집팀은 공식 문서 세 페이지를 직접 확인하고 중요 주장마다 출처를 연결했습니다. 실습 CSV는 코드로 다시 읽어 원본·정답·정리본 각각 12행, quantity 합계 19, 표준 이름 4개, 원본 이름 보존 여부를 검산했습니다. 이미지 세 장은 원본 크기로 확인했습니다.
작성 과정과 검토 기록
작성: AI 플레이집 편집팀
검수: AI 플레이집 운영 기준에 따른 공식 출처·실습 데이터·다운로드·링크 검수
AI 사용 공개: 공식 자료 탐색, 가상 CSV 설계, 초안 작성과 전용 이미지 제작에 AI를 사용했습니다. 표준 이름 매핑, 행 수, 수량 합계, 파일 해시와 공개 링크는 별도로 검증했습니다.
사실 확인일: 2026-08-24
다음 점검 예정: 2026-11-24
틀린 내용이나 내려받기 오류를 발견했다면 정정 정책에 안내된 방법으로 알려 주세요. 확인된 변경은 근거와 날짜를 남겨 수정합니다.
