본문으로 건너뛰기
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
IYA IYA

AI 실무 질문을 직접 재보고 알려드립니다

IYA IYA

AI 실무 질문을 직접 재보고 알려드립니다

  • HOME
  • 소개
  • 문의하기
  • 개인정보처리방침
  • 이용약관
  • AI
  • 전체 글
  • 토큰 비용 참고표
  • HOME
  • 소개
  • 문의하기
  • 개인정보처리방침
  • 이용약관
  • AI
  • 전체 글
  • 토큰 비용 참고표
닫기

검색

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
영어 대비 1.39배 — 한국어 토큰 비용 실측 (IYA 직접 측정)
AI

한국어는 영어보다 토큰을 얼마나 더 쓸까 — 직접 측정한 결과

By IYA 편집팀
2026년 09월 20일 4 Min Read
0

AI 서비스 요금은 글자 수가 아니라 토큰 단위로 매겨집니다. 그리고 한국어는 영어보다 토큰을 더 많이 씁니다. 그런데 얼마나 더 쓰는지에 대한 국내 자료는 대부분 추정이거나 오래된 수치입니다.

그래서 직접 측정했습니다. 아래 숫자는 전부 제가 실제로 돌려서 얻은 값이고, 이 글 맨 아래 코드로 누구나 똑같이 재현할 수 있습니다.

결론부터

측정 항목결과
한국어 : 영어 토큰 비율 (최신 토크나이저)1.39 ~ 1.55배
한국어 : 영어 토큰 비율 (이전 세대)2.22 ~ 2.88배
한국어 글자당 평균 토큰0.536 토큰
한국어 1,000자약 536 토큰
128,000 토큰 컨텍스트한국어 약 23만 9천 자
띄어쓰기를 없애면토큰 17.1% 증가 (줄지 않음)

가장 의외였던 것은 마지막 줄입니다. 공백을 지우면 글자 수가 줄어드니 토큰도 줄 것 같지만 반대로 늘어납니다. 이유는 뒤에서 설명합니다.

측정 방법

OpenAI가 공개한 토크나이저 라이브러리 tiktoken 0.14.0을 사용했습니다. 두 가지 인코딩을 비교했습니다.

  • o200k_base — GPT-4o 이후 세대 모델이 쓰는 인코딩
  • cl100k_base — GPT-3.5/GPT-4 세대가 쓰던 인코딩

한국어 문장과 같은 뜻의 영어 문장을 짝지어 각각의 토큰 수를 셌습니다. 단순 번역기 문장이 아니라 실제로 쓰일 법한 문체(업무 메일, 뉴스, 구어체, 계약 문구)로 구성했습니다.

미리 밝히는 한계: 이 수치는 OpenAI 계열 토크나이저 기준입니다. 다른 회사 모델은 토크나이저가 다르므로 숫자도 달라집니다. 경향(한국어가 더 비싸다, 세대가 지날수록 개선된다)은 비슷하지만 정확한 배수는 서비스마다 직접 확인해야 합니다.

결과 1 — 같은 뜻, 다른 토큰

문장 유형한국어 글자한국어 토큰영어 토큰배수
인사말17자991.00배
업무 이메일49자25171.47배
뉴스 문장45자23181.28배
설명문54자33181.83배
구어체29자20141.43배
계약 문구45자26221.18배
합계136981.39배

짧은 인사말은 차이가 없지만, 설명문처럼 서술어가 길어질수록 격차가 벌어집니다(1.83배). 한국어의 어미 변화가 토큰을 많이 잡아먹기 때문입니다.

긴 문단(한국어 293자)으로 같은 측정을 하면 1.55배가 나왔습니다. 문장이 길어질수록 평균 배수가 조금 올라갑니다.

결과 2 — 토크나이저 세대가 바뀌며 절반 가까이 줄었다

이번 측정에서 가장 실질적으로 중요한 발견입니다. 같은 문장을 이전 세대 인코딩으로 재면 이렇게 됩니다.

측정cl100k_base (이전)o200k_base (최신)개선
짧은 문장 6개 합계220 토큰136 토큰38% 감소
긴 문단291 토큰157 토큰46% 감소
영어 대비 배수2.22 ~ 2.88배1.39 ~ 1.55배약 절반

영어 쪽은 같은 문장에서 99 → 98 토큰으로 사실상 변화가 없었습니다. 즉 이 개선은 한국어를 비롯한 비영어권에 집중된 개선입니다.

실무적으로는 이런 뜻입니다. 예전에 한국어 API 비용을 계산해본 적이 있다면 그 수치는 지금 과대평가일 가능성이 높습니다. 구형 모델을 쓰고 있다면 최신 모델로 옮기는 것만으로 같은 작업의 토큰 비용이 크게 줄어들 수 있습니다.

결과 3 — 띄어쓰기를 없애면 토큰이 늘어난다

한국어 문장 10개를 정상 표기와 공백 제거본으로 각각 측정했습니다.

문장띄어쓰기 O공백 제거차이
오늘 날씨가 정말 좋네요78+1
인공지능 기술이 빠르게 발전하고 있습니다1013+3
어제 본 영화가 생각보다 훨씬 재미있었어요1418+4
계약서 내용을 다시 한번 확인해 주시기 바랍니다1216+4
건강을 위해서는 규칙적인 운동이 중요합니다1215+3
10문장 합계117137+20 (17.1%)

10문장 중 8문장에서 공백을 없앴을 때 토큰이 늘었고, 줄어든 문장은 하나도 없었습니다. 나머지 2문장은 동일했습니다.

왜 이런 일이 생기나

토크나이저는 자주 등장하는 글자 덩어리를 하나의 토큰으로 학습해 둡니다. 그런데 그 덩어리는 띄어쓰기가 정상인 문장으로 학습됐습니다. 공백을 지우면 학습해 둔 덩어리와 어긋나서, 단어가 더 잘게 쪼개집니다.

실제로 토큰이 어떻게 쪼개지는지 보면 이해가 빠릅니다.

입력토큰 수쪼개진 모양
안녕하세요2‘안’ / ‘녕하세요’
인공지능3‘인’ / ‘공지’ / ‘능’
서울특별시4‘서울’ / ‘특’ / ‘별’ / ‘시’
괜찮습니다4바이트 단위로 쪼개짐
Hello there2‘Hello’ / ‘ there’

‘안녕하세요’가 2토큰인데 ‘인공지능’이 3토큰인 것이 보입니다. 글자 수가 아니라 흔한 표현인지가 토큰 수를 결정합니다. ‘괜찮습니다’처럼 흔치 않은 조합은 바이트 단위까지 쪼개져 4토큰이 됩니다.

실무 결론: 토큰을 아끼겠다고 공백을 지우거나 줄임말을 쓰면 오히려 손해입니다. 맞춤법에 맞는 평범한 문장이 가장 토큰 효율이 좋습니다.

결과 4 — 텍스트 유형별 효율

유형예시글자당 토큰
파이썬 코드def add(a, b): return a + b0.35 (가장 효율적)
영문 혼용ChatGPT와 Claude를 비교해 봤습니다0.40
순우리말 위주우리 함께 걸으며 나눈 이야기가0.46
일반 문장안녕하세요 오늘 날씨가 정말 좋네요0.47
한자어 위주본인은 해당 사안에 관하여 이의를0.54
이모지 포함오늘 기분 최고! 😀🎉0.67
숫자·날짜2026년 9월 20일 오후 3시 30분0.73 (가장 비효율)

눈여겨볼 점이 두 가지 있습니다. 첫째, 숫자와 날짜가 의외로 비쌉니다. 표 형태의 데이터를 대량으로 넣을 때는 예상보다 토큰이 많이 듭니다. 둘째, 이모지 하나가 글자 하나보다 훨씬 비쌉니다. 프롬프트를 꾸미는 이모지는 비용 관점에서 손해입니다.

실무에 적용하기

1. 내 문서가 몇 토큰인지 어림잡기

한국어 글자 수에 0.54를 곱하면 대략 맞습니다.

분량예상 토큰
한국어 1,000자약 536 토큰
A4 1장 (약 880자)약 471 토큰
A4 10장약 4,700 토큰

2. 컨텍스트 한도를 글자로 환산하기

모델이 한 번에 처리한다고 광고하는 토큰 수는 한국어로는 이만큼입니다.

컨텍스트한국어 분량
128,000 토큰약 23만 9천 자 (A4 약 270장)
1,000,000 토큰약 186만 자 (A4 약 2,100장)

3. 토큰을 실제로 아끼는 방법

  • 공백과 맞춤법은 건드리지 마세요. 정상 표기가 가장 효율적입니다.
  • 반복되는 지시는 시스템 설정에 넣으세요. 매 요청마다 같은 문단을 붙이면 그만큼 매번 과금됩니다.
  • 불필요한 이모지와 장식을 빼세요. 생각보다 비쌉니다.
  • 긴 원문을 통째로 넣기 전에 필요한 부분만 잘라내세요. 가장 확실한 절감입니다.
  • 구형 모델을 쓰고 있다면 최신 세대로 옮기세요. 한국어는 그것만으로 40% 이상 줄 수 있습니다.

직접 재현해보기

아래 코드를 그대로 실행하면 이 글의 수치를 똑같이 확인할 수 있습니다. 파이썬과 pip install tiktoken만 있으면 됩니다.

import tiktoken

enc = tiktoken.get_encoding("o200k_base")   # 최신 세대
old = tiktoken.get_encoding("cl100k_base")  # 이전 세대

ko = "대규모 언어 모델은 방대한 양의 텍스트를 학습하여 다음에 올 단어를 예측하는 방식으로 작동합니다."
en = "A large language model works by learning from vast amounts of text and predicting the next word."

print(len(enc.encode(ko)), len(enc.encode(en)))   # 33 18
print(len(old.encode(ko)), len(old.encode(en)))   # 47 18

# 띄어쓰기 효과
s = "인공지능 기술이 빠르게 발전하고 있습니다"
print(len(enc.encode(s)), len(enc.encode(s.replace(" ", ""))))  # 10 13

# 토큰이 어떻게 쪼개지는지 보기
for t in ["안녕하세요", "인공지능", "서울특별시"]:
    ids = enc.encode(t)
    print(t, len(ids), [enc.decode([i]) for i in ids])

측정에 쓴 전체 문장 세트와 원본 수치는 위 표에 모두 공개해 두었습니다. 다른 문장으로 재보시면 수치가 조금씩 다를 수 있지만, 경향은 동일하게 나옵니다.

정리

  • 한국어는 영어보다 토큰을 1.4~1.6배 씁니다. 예전에 알려진 2배 이상이라는 수치는 구형 토크나이저 기준입니다.
  • 최신 세대 토크나이저로 오면서 한국어 효율이 약 40~46% 개선됐습니다. 영어는 거의 그대로입니다.
  • 띄어쓰기를 없애면 토큰이 17% 늘어납니다. 절대 하지 마세요.
  • 한국어 글자 수 × 0.54 로 토큰을 어림잡을 수 있습니다.
  • 숫자·날짜·이모지는 생각보다 비싸고, 코드와 영문은 효율적입니다.

측정 조건이나 결과에 대해 이견이 있으시면 문의 페이지로 알려주세요. 재측정해서 글에 반영하고, 무엇을 고쳤는지 밝히겠습니다.

측정일: 2026년 9월 20일 / tiktoken 0.14.0 / 인코딩 o200k_base, cl100k_base


이어서 읽기

  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표
  • AI에 표 데이터 넣을 때 — CSV·JSON·마크다운 중 뭐가 제일 쌀까
  • AI 뉴스가 쉬워지는 핵심 용어 사전 — LLM부터 에이전트까지
  • 토큰 아끼려다 더 쓴다 — 흔한 절약법 3가지 실측 검증
  • AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
  • 똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측
  • 한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
작성자

IYA 편집팀

IYA는 AI를 실제로 쓰는 사람들을 위한 실용 가이드를 만듭니다. 새 기술 소식을 빠르게 전하기보다, 그 기술을 어떻게 쓰고 무엇을 조심해야 하는지에 답하는 글을 씁니다. 모든 글은 게재 전 운영자가 직접 검토하며, 사실과 다른 내용을 발견하시면 문의 페이지로 알려주시면 확인 후 바로잡습니다.

Follow Me
다른 기사
AI 시대 아이 교육 안내 그래픽 — AI 시대 아이 교육 — 숙제에 AI 쓴 아이, 어떻게 지도할까
Previous

AI 시대 아이 교육 — 숙제에 AI 쓴 아이, 어떻게 지도할까

CSV vs JSON — 표 데이터 최대 2.6배 차이 (IYA 직접 측정)
Next

AI에 표 데이터 넣을 때 — CSV·JSON·마크다운 중 뭐가 제일 쌀까

댓글 없음! 첫 댓글을 남겨보세요.

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

IYA 소개

AI를 실제로 쓸 때 부딪히는 비용·성능 질문을 직접 측정하고, 재현 코드와 함께 공개합니다. 측정한 글에는 측정 조건과 한계를 함께 싣습니다.

검색

최신 글

  • AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
  • 한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
  • 똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측
  • 토큰 아끼려다 더 쓴다 — 흔한 절약법 3가지 실측 검증
  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표

문의

글의 오류 신고나 다뤘으면 하는 주제 제안을 환영합니다.

iya@iya.co.kr

IYA 소개

AI를 실제로 쓸 때 부딪히는 비용·성능 질문을 직접 측정하고, 재현 코드와 함께 공개합니다. 측정한 글에는 측정 조건과 한계를 함께 싣습니다.

최신 글

  • AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
  • 한국어 AI 토큰 비용 종합 참고표 — 실측 수치 한 페이지 정리
  • 똑같아 보이는 한글이 토큰을 11배 쓴다 — 자모 분리(NFD) 실측
  • 토큰 아끼려다 더 쓴다 — 흔한 절약법 3가지 실측 검증
  • 내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표

카테고리

  • AI (11)
  • TECH (6)
  • 문화 (4)
Copyright 2026 — IYA. All rights reserved. Blogsy WordPress Theme