본문으로 건너뛰기
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
IYA IYA

AI 실무 질문을 직접 재보고 알려드립니다

IYA IYA

AI 실무 질문을 직접 재보고 알려드립니다

  • HOME
  • 소개
  • 문의하기
  • 개인정보처리방침
  • 이용약관
  • AI
  • 전체 글
  • 토큰 비용 참고표
  • HOME
  • 소개
  • 문의하기
  • 개인정보처리방침
  • 이용약관
  • AI
  • 전체 글
  • 토큰 비용 참고표
닫기

검색

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
실측 수치 총정리 — 측정 시리즈를 한 페이지에 (IYA 직접 측정)
AI

한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리

By IYA 편집팀
2026년 09월 21일 3 Min Read
0

이 페이지는 저희가 직접 측정한 한국어 AI 토큰 비용 데이터를 한 곳에 모은 참고표입니다. 필요한 항목을 바로 찾아 쓰시라고 만들었습니다.

모든 수치는 tiktoken 0.14.0의 o200k_base 인코딩으로 직접 측정한 값입니다. 각 항목의 측정 방법과 재현 코드는 연결된 글에 있습니다.

1. 가장 자주 찾는 숫자

항목값
한국어 글자당 평균 토큰0.54 (문서 평균 0.58)
한국어 1,000자약 536 토큰
A4 1장 (약 880자)약 510 토큰
한국어 : 영어 토큰 비율1.39 ~ 1.55배
128K 컨텍스트 = 한국어약 23만 9천 자 (A4 약 250장)
1M 컨텍스트 = 한국어약 186만 자 (A4 약 2,100장)

암산용: 글자 수 × 0.6이면 대부분 맞습니다. → 측정 근거

2. 문서 종류별 글자당 토큰

문서글자당비고
뉴스 기사0.538가장 효율적
업무 이메일0.543
이력서0.545
논문 초록0.565
회의록0.617숫자·기호 많음
블로그 글0.619
계약서0.625가장 비효율 (한자어+번호)

→ 문서 종류별 기준표 전문

3. 텍스트 유형별

유형글자당예
SQL0.29가장 효율적
Java 코드0.27글자당은 최저, 총량은 최다
Python 코드0.41
영문 혼용0.40
한국어 일반 문장0.47
한자어 위주0.54
이모지 포함0.67
숫자·날짜0.73가장 비효율

→ 코드 언어별 비교

4. 데이터를 넣을 때 — 형식별 비용

형식5행500행CSV 대비
CSV / TSV998,415100%
마크다운 표124—125%
자연어 문장132—133%
JSON (압축)16616,402168~195%
YAML191—193%
JSON (들여쓰기)261—264%

JSON 키를 영문으로 바꾸면 18% 절약됩니다. → 형식별 실측 전문

5. 숫자·날짜 표기

표기토큰
12345673
125만원2 (최저)
1,234,5675
백이십삼만…12
202609213 (최저)
2026-09-216
2026년 9월 21일9
1790000000 (타임스탬프)4
2026-09-21 14:3010

100행 표에서 표기만 바꿔 53% 절감 가능. → 숫자·날짜 실측 전문

6. 절대 하면 안 되는 것 — 오히려 늘어납니다

행위결과
띄어쓰기 없애기토큰 +17%
줄임말 쓰기 (ㅇㅇ, ㄱㄱ)정상 표기의 1.5배
오타 방치+62%
한글 자모 분리(NFD)평균 11배, 최대 18배
zero-width space 섞임3.26배
non-breaking space 섞임1.73배
이중 공백1.47배

“ㅇㅇ 알겠음 ㄱㄱ”(9자)가 “네 알겠습니다 시작하죠”(12자)보다 토큰을 1.5배 씁니다. 짧게 줄여 쓰는 것은 절약이 아닙니다.

→ 절약법 통념 검증 / → 자모 분리 실측 / → 보이지 않는 문자

7. 효과 없는 것

흔한 조언실제 효과
프롬프트를 영어로 번역1.9% (본문이 한국어면 무의미)
반말·문체 바꾸기거의 없음 (0.50~0.56)
줄바꿈 일일이 정리4%

8. 실제로 효과 있는 것 — 우선순위

순위방법효과
1넣을 원문에서 불필요한 부분 삭제가장 큼
2보이지 않는 문자 제거 + NFC 정규화최대 11배
3대화를 10턴마다 새로 시작75%
4표를 JSON 대신 CSV로최대 2배
5숫자·날짜 표기 압축53%
6구형 모델 → 최신 세대한국어 40%+

9. 대화 비용 — 턴이 쌓일수록

턴누적 입력 토큰독립 질문 대비
1턴591배
5턴1,78530배
10턴7,295124배
20턴29,490500배

문서를 첨부하고 10턴 대화하면 비용의 80%가 문서 재전송입니다. → 대화 누적 비용 실측

10. 긴 문서 분할 전략

전략원문 대비
문단 단위 (겹침 없음)1.00배
300자 고정, 겹침 없음1.01배
+ 짧은 헤더 [3/6]1.07배
300자, 20퍼센트 겹침1.21배
300자, 30퍼센트 겹침1.32배
긴 헤더 + 겹침1.48배

문단 경계로 자르면 겹침이 필요 없어 추가 비용이 0입니다. 조각 크기는 비용에 거의 영향이 없으니 품질 기준으로 정하세요. 헤더는 200조각이면 그것만 3,600토큰이 되므로 짧게 쓰세요. → 분할 전략 실측 전문

내 텍스트를 직접 재는 법

pip install tiktoken

import tiktoken, unicodedata, re
enc = tiktoken.get_encoding("o200k_base")

def check(text):
    # 오염 확인
    zw = text.count("\u200b")
    nb = text.count("\u00a0")
    nfd = len(text) != len(unicodedata.normalize("NFC", text))
    # 정리 후 비교
    clean = unicodedata.normalize("NFC", text)
    clean = clean.replace("\u200b", "").replace("\u00a0", " ")
    clean = re.sub(r"[ \t]+", " ", clean)

    print(f"글자 {len(text)} / 토큰 {len(enc.encode(text))}")
    print(f"정리 후 토큰 {len(enc.encode(clean))}")
    print(f"zero-width {zw}개 / nbsp {nb}개 / NFD {'있음' if nfd else '없음'}")

check(내_텍스트)

측정 조건과 한계

  • 모든 수치는 tiktoken 0.14.0 / o200k_base(GPT-4o 이후 세대) 기준입니다.
  • 다른 회사 모델은 토크나이저가 달라 수치가 다릅니다. 경향은 비슷하지만 정확한 배수는 각 서비스에서 확인하세요.
  • 측정 표본은 전부 직접 작성했습니다. 저작권이 있는 타인의 문서는 쓰지 않았습니다.
  • 토큰 수만 측정했고 AI의 이해 정확도는 측정하지 않았습니다. 압축 표기를 쓸 때는 형식을 명시하세요.
  • 실제 서비스는 캐싱이나 요약을 적용하기도 하므로 청구액이 계산과 다를 수 있습니다.

수치에 이견이 있거나 측정해봤으면 하는 항목이 있으면 문의 페이지로 알려주세요. 재측정해서 이 표에 반영하고, 무엇을 고쳤는지 밝히겠습니다.

최종 갱신: 2026년 9월 22일 / tiktoken 0.14.0, 인코딩 o200k_base 기준


이어서 읽기

  • 한국어는 영어보다 토큰을 얼마나 더 쓸까 — 직접 측정한 결과
  • AI에 표 데이터 넣을 때 — CSV·JSON·마크다운 중 뭐가 제일 쌀까
  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표
작성자

IYA 편집팀

IYA는 AI를 실제로 쓰는 사람들을 위한 실용 가이드를 만듭니다. 새 기술 소식을 빠르게 전하기보다, 그 기술을 어떻게 쓰고 무엇을 조심해야 하는지에 답하는 글을 씁니다. 모든 글은 게재 전 운영자가 직접 검토하며, 사실과 다른 내용을 발견하시면 문의 페이지로 알려주시면 확인 후 바로잡습니다.

Follow Me
다른 기사
토큰 11배 — 눈에 안 보이는 자모 분리 (IYA 직접 측정)
Previous

똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측

비용 25배 — 대화가 길어질수록 가파르게 (IYA 직접 측정)
Next

AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측

댓글 없음! 첫 댓글을 남겨보세요.

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

IYA 소개

AI를 실제로 쓸 때 부딪히는 비용·성능 질문을 직접 측정하고, 재현 코드와 함께 공개합니다. 추정한 숫자가 아니라 실제로 재본 숫자만 싣습니다.

검색

최신 글

  • AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
  • 한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
  • 똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측
  • 토큰 아끼려다 더 쓴다 — 흔한 절약법 3가지 실측 검증
  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표

문의

글의 오류 신고나 다뤘으면 하는 주제 제안을 환영합니다.

iya@iya.co.kr

IYA 소개

AI를 실제로 쓸 때 부딪히는 비용·성능 질문을 직접 측정하고, 재현 코드와 함께 공개합니다. 추정한 숫자가 아니라 실제로 재본 숫자만 싣습니다.

최신 글

  • AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
  • 한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
  • 똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측
  • 토큰 아끼려다 더 쓴다 — 흔한 절약법 3가지 실측 검증
  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표

카테고리

  • AI (11)
  • TECH (6)
  • 문화 (4)
Copyright 2026 — IYA. All rights reserved. Blogsy WordPress Theme