분명 짧은 한 줄인데 왜 토큰은 예상보다 많을까요? 답은 토큰이 글자 한 개와 같은 단위가 아니기 때문입니다. ChatGPT 같은 언어 모델은 문장을 그대로 한 덩어리로 읽지 않고, 처리하기 좋은 문자 조각의 묶음으로 나누어 다룹니다.
이 글을 읽고 나면 토큰·글자·인코딩의 차이를 설명하고, 숫자 하나만 보고 질문의 좋고 나쁨을 판단하지 않게 됩니다. 한국어·영어·숫자·기호가 섞인 8문장을 직접 비교할 수 있도록 실습 TXT와 정답 PDF도 준비했습니다.
토큰 관찰 실습 TXT 내려받기 · 측정값·실패 화면·수정법 PDF 내려받기

먼저 결론: 토큰은 글자가 아니라 문자 조각의 묶음입니다
OpenAI 공식 Tokenizer는 언어 모델이 텍스트를 토큰으로 처리하며, 토큰은 문장에서 자주 나타나는 문자들의 묶음이라고 설명합니다. 여기서 토큰은 글자 한 개일 수도 있지만, 여러 글자가 한 토큰이 되거나 한 글자가 여러 토큰으로 나뉘는 경우도 있습니다.
따라서 “10글자는 항상 10토큰”처럼 바꿔 계산할 수 없습니다. 언어, 띄어쓰기, 숫자, 기호, 사용하는 모델과 인코딩이 달라지면 나누는 결과도 달라질 수 있습니다.
이 글이 필요한 사람과 준비물
- 대상: ChatGPT를 처음 쓰며 토큰이라는 말을 처음 본 사람
- 사전 지식: 없음
- 준비물: 내려받은 TXT, 정답 PDF, 메모장 또는 종이
- 걸리는 시간: 약 10분
완료 기준: 글자 수와 토큰 수가 같은 개념이 아니라고 설명하고, 같은 문장도 인코딩에 따라 수치가 달라질 수 있다고 말할 수 있으면 됩니다.
가장 쉬운 예시부터 보기
아래 두 문장을 글자 수만 보고 비교해 보겠습니다.
T-01 회의는 오후 3시에 시작합니다. T-04 Please summarize the report.
공백과 문장부호를 포함하면 T-01은 17글자, T-04는 28글자입니다. 하지만 이번 실습에서 사용한 o200k_base 인코딩으로 측정하면 T-01은 9토큰, T-04는 5토큰이었습니다. 글자가 더 많은 영어 문장의 토큰 수가 더 적게 나온 것입니다.
이 결과는 “영어는 언제나 적다”는 규칙이 아닙니다. 글자 수만으로 토큰 수를 정확히 예측할 수 없다는 관찰입니다. 문장과 인코딩이 바뀌면 결과도 달라질 수 있습니다.
실습에 쓰는 네 용어
1. 글자
사람이 화면에서 세는 문자입니다. 한글, 영문, 숫자, 공백, 문장부호를 어떤 기준으로 셀지에 따라 글자 수 표시는 달라질 수 있습니다.
2. 토큰
언어 모델이 텍스트를 처리할 때 사용하는 문자 조각의 묶음입니다. 단어 전체, 단어의 일부, 공백과 함께 있는 글자, 숫자나 기호가 각각 토큰이 될 수 있습니다.
3. 토크나이저
토크나이저는 문장을 토큰으로 나누는 도구입니다. OpenAI 공식 Tokenizer에 문장을 넣으면 어떤 조각으로 나뉘는지와 전체 토큰 수를 관찰할 수 있습니다.
4. 인코딩
이 글에서 인코딩은 텍스트를 어떤 토큰 조각으로 나눌지 정한 규칙 모음이라는 뜻으로 사용합니다. 모델 계열이 달라지면 연결되는 인코딩도 달라질 수 있습니다.
용어가 한꺼번에 어렵다면 ChatGPT 초보자 용어 사전을 먼저 열어 두고 읽어도 좋습니다.
토큰 수가 글자 수와 달라지는 세 가지 이유
이유 1: 자주 나타나는 문자 묶음이 함께 처리될 수 있습니다
모델은 모든 글자를 무조건 한 글자씩 나누지 않습니다. 학습 과정에서 자주 나타난 문자들의 관계에 따라 여러 글자가 하나의 토큰 조각이 되기도 합니다.
이유 2: 숫자와 기호도 별도 조각으로 나뉠 수 있습니다
날짜, 시각, 하이픈, 세로선, 밑줄이 섞이면 사람이 보기에는 짧은 한 줄이어도 여러 조각으로 나뉠 수 있습니다. 실습 문장 T-08은 날짜·시각·구분 기호가 함께 있어 o200k_base에서 15토큰, cl100k_base에서 20토큰으로 측정됐습니다.
이유 3: 사용하는 인코딩이 다르면 결과도 달라질 수 있습니다
T-01은 o200k_base에서 9토큰, cl100k_base에서 13토큰이었습니다. 따라서 토큰 수를 기록할 때는 문장만 적지 말고 모델 또는 인코딩 이름과 확인 날짜도 함께 남기는 편이 안전합니다.
8문장 토큰 관찰 실습
1단계: 정답을 보지 말고 먼저 예상합니다
실습 TXT에서 T-01부터 T-08까지 읽습니다. 글자 수가 많아 보이는 순서와 토큰이 많을 것 같은 순서를 각각 적습니다.
성공 확인: 각 문장 옆에 예상 순위와 이유를 한 줄씩 적었습니다.
2단계: 숫자와 기호가 있는 문장을 표시합니다
T-01, T-02, T-06, T-07, T-08에서 숫자·밑줄·쉼표·이모지·세로선을 찾아 동그라미 칩니다.
성공 확인: 눈에 보이는 글자 길이 외에 토큰 나눔에 영향을 줄 수 있는 요소를 찾았습니다.
3단계: PDF 정답표와 비교합니다
정답 PDF 2쪽에는 글자 수와 두 인코딩의 측정값이 나란히 있습니다. 예상과 다른 문장 두 개를 고릅니다.
성공 확인: 글자 수 순서와 토큰 수 순서가 다른 사례를 두 개 찾았습니다.
4단계: 인코딩 차이를 찾습니다
o200k_base와 cl100k_base 열을 비교합니다. 이번 자료에서는 T-01, T-03, T-05, T-07, T-08의 수치가 달랐습니다.
성공 확인: 같은 문장도 나누는 규칙이 다르면 수치가 달라질 수 있다고 설명했습니다.
5단계: 내 말로 한 문장 정리합니다
토큰은 글자 한 개가 아니라 모델이 문장을 처리하도록 나눈 문자 조각의 묶음이다.
이 문장을 그대로 외울 필요는 없습니다. “글자 수와 토큰 수는 항상 같지 않다”는 뜻이 들어가면 됩니다.
직접 측정한 결과에서 보이는 점
- T-03 ‘보고서를 요약해 주세요.’는 13글자, 두 인코딩에서 각각 7토큰과 11토큰이었습니다.
- T-04 ‘Please summarize the report.’는 28글자, 두 인코딩 모두 5토큰이었습니다.
- T-06 ‘order_id, promised_date, shipped_date’는 37글자, 두 인코딩 모두 8토큰이었습니다.
- T-08 ‘2026-08-15 | 06:00 | 게시 준비 완료’는 29글자, 두 인코딩에서 각각 15토큰과 20토큰이었습니다.
이 수치는 tiktoken 0.13.0으로 문장 자체만 측정한 결과입니다. 실제 ChatGPT 대화 전체에는 이전 대화 문맥, 내부 지시, 도구 사용처럼 화면의 한 문장만으로 알기 어려운 요소가 포함될 수 있으므로 이 숫자를 계정 한도나 비용의 확정값으로 사용하면 안 됩니다.
잘못된 결과를 되돌리는 방법
실패 1: 공식 Tokenizer에 0만 보입니다
입력 칸이 비어 있거나 붙여넣기가 적용되지 않았을 수 있습니다. 수정: 입력 칸을 클릭하고 문장을 다시 붙여넣은 뒤 현재 선택된 모델 묶음을 확인합니다.
실패 2: 이 글의 수치와 내 화면이 다릅니다
도구가 사용하는 모델 묶음이나 인코딩이 다를 수 있습니다. 수정: 모델·인코딩·확인 날짜를 함께 적고 같은 조건에서 다시 비교합니다.
실패 3: 토큰을 줄이려고 중요한 조건까지 지웁니다
토큰이 적다고 질문이 자동으로 좋아지는 것은 아닙니다. 수정: 목적·자료·조건·출력 형식은 남기고, 같은 설명이 반복되는 부분만 줄입니다. 질문의 기본 구조는 프롬프트 기본 구조에서 차근차근 확인할 수 있습니다.
실패 4: 영어 기준 환산식을 한국어에 그대로 적용합니다
OpenAI 공식 Tokenizer가 소개하는 ‘한 토큰은 대략 영어 4글자’라는 값은 흔한 영어 문장을 위한 대략적인 기준입니다. 수정: 한국어 문장은 같은 환산식을 확정 규칙처럼 쓰지 말고 실제 도구에서 관찰합니다.
조금 더 알아보기: 입력·출력·전체 토큰
OpenAI API 참고 문서의 사용량 정보에는 프롬프트 토큰, 완성 토큰, 전체 토큰 같은 항목이 나옵니다. 쉽게 말해 API 요청에 들어간 부분, 모델이 만든 부분, 두 부분을 합친 사용량을 나누어 보는 방식입니다.
이 구분은 API를 사용할 때 더 직접적으로 만납니다. 처음 API를 시작한다면 ChatGPT API 시작 전 체크리스트에서 계정·키·요금·검수 범위를 먼저 확인하세요.
안전한 사용 순서
- 원하는 결과를 한 문장으로 적습니다.
- 답에 꼭 필요한 자료와 조건을 붙입니다.
- 같은 설명이 반복되는 부분만 한 번으로 줄입니다.
- 중요한 작업은 토큰 수보다 원문 대조와 결과 검산을 우선합니다.
실습에는 실제 이름, 전화번호, 이메일, 고객 주문, 회사 비밀을 넣지 마세요. 이 글의 가상 문장만 사용하거나 민감한 부분을 [이름], [날짜], [금액]처럼 바꿔 연습하면 됩니다.
직접 다시 확인해야 하는 범위
- 토큰 나눔과 수치는 모델 및 인코딩이 바뀌면 달라질 수 있습니다.
- 공식 Tokenizer 화면 구성과 선택 항목은 업데이트될 수 있습니다.
- 이 글의 측정값은 문장 자체의 관찰값이며 실제 ChatGPT 대화 전체 사용량이 아닙니다.
- 토큰 수만으로 답변의 정확도나 질문의 품질을 판단할 수 없습니다.
- 요금·계정 한도·모델별 제한은 이 글에서 확정하지 않습니다. 필요한 시점에 공식 최신 안내를 다시 확인해야 합니다.
결과물 마지막 점검
- 토큰과 글자 수를 구분했습니다.
- 측정 조건에 모델 또는 인코딩 이름을 적었습니다.
- 관찰값을 요금이나 계정 한도의 확정값으로 사용하지 않았습니다.
- 질문의 명확성을 해치면서까지 문장을 억지로 줄이지 않았습니다.
- 중요한 답은 출처와 원문으로 다시 확인합니다.
확인한 자료와 수정 창구
작성: AI 플레이집 편집팀 · 검토: AI 플레이집 운영자 · 사실 확인: 2026-08-15
공식 OpenAI 문서 확인, 가상 문장 구성, tiktoken 측정, TXT·PDF·대표 이미지 초안 제작에 AI와 코드를 사용했습니다. PDF 3쪽 전체와 대표 이미지를 렌더링해 한글·배치·잘림·문자 오류를 확인했습니다. 오류 제보와 수정 이력은 정정 정책에서 확인할 수 있습니다.
