한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
이 페이지는 저희가 직접 측정한 한국어 AI 토큰 비용 데이터를 한 곳에 모은 참고표입니다. 필요한 항목을 바로 찾아 쓰시라고 만들었습니다.
모든 수치는 tiktoken 0.14.0의 o200k_base 인코딩으로 직접 측정한 값입니다. 각 항목의 측정 방법과 재현 코드는 연결된 글에 있습니다.
1. 가장 자주 찾는 숫자
| 항목 | 값 |
|---|---|
| 한국어 글자당 평균 토큰 | 0.54 (문서 평균 0.58) |
| 한국어 1,000자 | 약 536 토큰 |
| A4 1장 (약 880자) | 약 510 토큰 |
| 한국어 : 영어 토큰 비율 | 1.39 ~ 1.55배 |
| 128K 컨텍스트 = 한국어 | 약 23만 9천 자 (A4 약 250장) |
| 1M 컨텍스트 = 한국어 | 약 186만 자 (A4 약 2,100장) |
암산용: 글자 수 × 0.6이면 대부분 맞습니다. → 측정 근거
2. 문서 종류별 글자당 토큰
| 문서 | 글자당 | 비고 |
|---|---|---|
| 뉴스 기사 | 0.538 | 가장 효율적 |
| 업무 이메일 | 0.543 | |
| 이력서 | 0.545 | |
| 논문 초록 | 0.565 | |
| 회의록 | 0.617 | 숫자·기호 많음 |
| 블로그 글 | 0.619 | |
| 계약서 | 0.625 | 가장 비효율 (한자어+번호) |
3. 텍스트 유형별
| 유형 | 글자당 | 예 |
|---|---|---|
| SQL | 0.29 | 가장 효율적 |
| Java 코드 | 0.27 | 글자당은 최저, 총량은 최다 |
| Python 코드 | 0.41 | |
| 영문 혼용 | 0.40 | |
| 한국어 일반 문장 | 0.47 | |
| 한자어 위주 | 0.54 | |
| 이모지 포함 | 0.67 | |
| 숫자·날짜 | 0.73 | 가장 비효율 |
→ 코드 언어별 비교
4. 데이터를 넣을 때 — 형식별 비용
| 형식 | 5행 | 500행 | CSV 대비 |
|---|---|---|---|
| CSV / TSV | 99 | 8,415 | 100% |
| 마크다운 표 | 124 | — | 125% |
| 자연어 문장 | 132 | — | 133% |
| JSON (압축) | 166 | 16,402 | 168~195% |
| YAML | 191 | — | 193% |
| JSON (들여쓰기) | 261 | — | 264% |
JSON 키를 영문으로 바꾸면 18% 절약됩니다. → 형식별 실측 전문
5. 숫자·날짜 표기
| 표기 | 토큰 |
|---|---|
1234567 | 3 |
125만원 | 2 (최저) |
1,234,567 | 5 |
백이십삼만… | 12 |
20260921 | 3 (최저) |
2026-09-21 | 6 |
2026년 9월 21일 | 9 |
1790000000 (타임스탬프) | 4 |
2026-09-21 14:30 | 10 |
100행 표에서 표기만 바꿔 53% 절감 가능. → 숫자·날짜 실측 전문
6. 절대 하면 안 되는 것 — 오히려 늘어납니다
| 행위 | 결과 |
|---|---|
| 띄어쓰기 없애기 | 토큰 +17% |
| 줄임말 쓰기 (ㅇㅇ, ㄱㄱ) | 정상 표기의 1.5배 |
| 오타 방치 | +62% |
| 한글 자모 분리(NFD) | 평균 11배, 최대 18배 |
| zero-width space 섞임 | 3.26배 |
| non-breaking space 섞임 | 1.73배 |
| 이중 공백 | 1.47배 |
“ㅇㅇ 알겠음 ㄱㄱ”(9자)가 “네 알겠습니다 시작하죠”(12자)보다 토큰을 1.5배 씁니다. 짧게 줄여 쓰는 것은 절약이 아닙니다.
→ 절약법 통념 검증 / → 자모 분리 실측 / → 보이지 않는 문자
7. 효과 없는 것
| 흔한 조언 | 실제 효과 |
|---|---|
| 프롬프트를 영어로 번역 | 1.9% (본문이 한국어면 무의미) |
| 반말·문체 바꾸기 | 거의 없음 (0.50~0.56) |
| 줄바꿈 일일이 정리 | 4% |
8. 실제로 효과 있는 것 — 우선순위
| 순위 | 방법 | 효과 |
|---|---|---|
| 1 | 넣을 원문에서 불필요한 부분 삭제 | 가장 큼 |
| 2 | 보이지 않는 문자 제거 + NFC 정규화 | 최대 11배 |
| 3 | 대화를 10턴마다 새로 시작 | 75% |
| 4 | 표를 JSON 대신 CSV로 | 최대 2배 |
| 5 | 숫자·날짜 표기 압축 | 53% |
| 6 | 구형 모델 → 최신 세대 | 한국어 40%+ |
9. 대화 비용 — 턴이 쌓일수록
| 턴 | 누적 입력 토큰 | 독립 질문 대비 |
|---|---|---|
| 1턴 | 59 | 1배 |
| 5턴 | 1,785 | 30배 |
| 10턴 | 7,295 | 124배 |
| 20턴 | 29,490 | 500배 |
문서를 첨부하고 10턴 대화하면 비용의 80%가 문서 재전송입니다. → 대화 누적 비용 실측
10. 긴 문서 분할 전략
| 전략 | 원문 대비 |
|---|---|
| 문단 단위 (겹침 없음) | 1.00배 |
| 300자 고정, 겹침 없음 | 1.01배 |
+ 짧은 헤더 [3/6] | 1.07배 |
| 300자, 20퍼센트 겹침 | 1.21배 |
| 300자, 30퍼센트 겹침 | 1.32배 |
| 긴 헤더 + 겹침 | 1.48배 |
문단 경계로 자르면 겹침이 필요 없어 추가 비용이 0입니다. 조각 크기는 비용에 거의 영향이 없으니 품질 기준으로 정하세요. 헤더는 200조각이면 그것만 3,600토큰이 되므로 짧게 쓰세요. → 분할 전략 실측 전문
내 텍스트를 직접 재는 법
pip install tiktoken
import tiktoken, unicodedata, re
enc = tiktoken.get_encoding("o200k_base")
def check(text):
# 오염 확인
zw = text.count("\u200b")
nb = text.count("\u00a0")
nfd = len(text) != len(unicodedata.normalize("NFC", text))
# 정리 후 비교
clean = unicodedata.normalize("NFC", text)
clean = clean.replace("\u200b", "").replace("\u00a0", " ")
clean = re.sub(r"[ \t]+", " ", clean)
print(f"글자 {len(text)} / 토큰 {len(enc.encode(text))}")
print(f"정리 후 토큰 {len(enc.encode(clean))}")
print(f"zero-width {zw}개 / nbsp {nb}개 / NFD {'있음' if nfd else '없음'}")
check(내_텍스트)측정 조건과 한계
- 모든 수치는
tiktoken 0.14.0/o200k_base(GPT-4o 이후 세대) 기준입니다. - 다른 회사 모델은 토크나이저가 달라 수치가 다릅니다. 경향은 비슷하지만 정확한 배수는 각 서비스에서 확인하세요.
- 측정 표본은 전부 직접 작성했습니다. 저작권이 있는 타인의 문서는 쓰지 않았습니다.
- 토큰 수만 측정했고 AI의 이해 정확도는 측정하지 않았습니다. 압축 표기를 쓸 때는 형식을 명시하세요.
- 실제 서비스는 캐싱이나 요약을 적용하기도 하므로 청구액이 계산과 다를 수 있습니다.
수치에 이견이 있거나 측정해봤으면 하는 항목이 있으면 문의 페이지로 알려주세요. 재측정해서 이 표에 반영하고, 무엇을 고쳤는지 밝히겠습니다.
최종 갱신: 2026년 9월 22일 / tiktoken 0.14.0, 인코딩 o200k_base 기준