← 목록으로
AI 데이터센터(AIDC)③ AIDC파생 용어난이도 기본

토큰(Token)

Token
「LLM (거대언어모델, Large Language Model)」의 파생 용어입니다.
토큰(Token)은 대형 언어 모델(LLM)이 텍스트를 처리할 때 사용하는 최소 단위로, 단어·음절·문자 등 다양한 형태로 분할된 텍스트 조각이다. LLM은 문장을 토큰 단위로 쪼개어 수치 벡터로 변환한 뒤 연산을 수행하며, 토큰 수는 모델의 처리 용량·비용·속도를 결정짓는 핵심 척도다.
관련 개념 웹툰 상위 용어 「LLM (거대언어모델, Large Language Model)」
LLM (거대언어모델, Large Language Model) — 4컷 웹툰 설명
  1. 1도서관 통째로 삼킨 AI?!
  2. 2수억 개 문장을 꿀꺽!
  3. 3말 잘하는 초거대 두뇌 탄생!
  4. 4데이터센터가 키운 언어 천재

정의와 배경

토큰은 LLM이 자연어를 이해하고 생성하기 위해 텍스트를 분할한 기본 단위다. 사람이 글을 읽을 때 단어나 문장 단위로 인식하는 것과 달리, LLM은 텍스트를 토크나이저(tokenizer)라는 알고리즘을 통해 더 작은 조각으로 분해한다. 영어의 경우 평균적으로 단어 하나가 약 1~2개의 토큰에 해당하며, 한국어처럼 형태소 구조가 복잡한 언어는 동일한 의미를 표현하는 데 더 많은 토큰이 필요할 수 있다. 이처럼 토큰은 언어마다 그 분할 방식과 효율이 달라지므로, 다국어 모델 개발에서 중요한 설계 요소로 다루어진다.

작동 원리와 종류

토크나이저는 주로 BPE(Byte Pair Encoding), WordPiece, SentencePiece 등의 알고리즘을 사용해 텍스트를 토큰으로 변환한다. 분할된 각 토큰은 고유한 정수 ID로 매핑되어 모델 내부에서 수치 벡터(임베딩)로 처리된다. LLM은 이 벡터들을 트랜스포머 구조를 통해 연산하며, 다음에 올 토큰의 확률을 예측하는 방식으로 텍스트를 생성한다. 토큰의 종류는 단어 전체(word-level), 하위 단어(subword-level), 문자(character-level) 등으로 구분되며, 현재 대부분의 LLM은 어휘 범위와 연산 효율을 균형 있게 맞추는 하위 단어 방식을 채택한다.

왜 중요한가

토큰은 LLM의 성능·비용·한계를 결정하는 실질적 단위이기 때문에 정책·산업 실무에서 직접적인 의미를 갖는다. 모델이 한 번에 처리할 수 있는 최대 토큰 수를 '컨텍스트 윈도우(context window)'라 하며, 이 범위를 초과한 정보는 모델이 참조할 수 없다. 클라우드 기반 AI 서비스의 과금 체계도 대부분 입력·출력 토큰 수를 기준으로 산정되므로, 공공기관이 AI 서비스를 도입할 때 총비용 추정과 예산 계획의 기초 단위가 된다. 또한 대규모 학습에 사용되는 토큰 수(수조 토큰 단위)는 모델의 지식 범위와 능력을 가늠하는 지표로도 활용된다.

AIDC 메가프로젝트 맥락

AI 데이터센터(AIDC) 인프라의 규모와 직결되는 개념이 바로 토큰 처리 속도와 처리량이다. GPU 클러스터가 초당 생성·처리하는 토큰 수(토큰 처리량, tokens per second)는 데이터센터의 실질적 AI 서비스 용량을 나타내는 성능 지표로 사용된다. 대한민국의 AIDC 메가프로젝트(1단계 8.4GW·2029년까지 구축, 2단계 추가 10GW·2035년까지 확장)와 같은 대규모 컴퓨팅 인프라 구축은 결국 더 많은 토큰을 더 빠르게 처리하기 위한 물리적 기반을 확충하는 것이라 볼 수 있다. 따라서 토큰은 추상적인 AI 개념이 아니라 전력·냉각·GPU 수요로 이어지는 인프라 계획의 출발점이 되는 단위다.

※ 본 상세 설명은 용어집 데이터를 토대로 AI가 생성했습니다. 정확한 내용은 원문 출처를 우선하세요.

?확인 문제0/3
「토큰(Token)」은(는) 어느 기본 용어에서 파생된 개념인가요?
「토큰(Token)」은(는) 어느 계열에 속하나요?
「토큰(Token)」은(는) 어느 메가프로젝트에 해당하나요?