한국어는 정교한 높임법과 문장성분 생략, 조사와 어미의 다양한 결합 등 복잡한 규칙을 지닌 언어다. AI가 한국어를 제대로 이해하려면 이러한 구조뿐 아니라 대화에 담긴 문화적 맥락까지 파악해야 한다. 한글날을 맞아 신효필 서울대학교 언어학과 교수의 기고를 통해 한국어의 특성이 AI의 답변 품질에 미치는 영향과 소버린 AI의 필요성에 대해 살펴봤다.

최근 거대언어모델(LLM)의 비약적인 발전에도 불구하고, 한국어처럼 단어의 형태 변화가 다양하고 구조가 복잡한 언어 환경에서 인공지능의 실제 언어 능력을 정확히 평가하는 데는 한계가 존재해 왔다. 한국어 능력을 정밀하게 측정할 수 있는 공통된 평가 기준이 없었기 때문이다.
서울대학교 자연어처리연구실이 개발한 ‘KoBALT’는 이러한 문제의식에서 출발한 벤치마크, 즉 AI 성능 평가 도구다. 통사론, 의미론, 화용론, 음성/음운론, 형태론 등 5개 핵심 언어학 영역에서 전문가들이 직접 선별한 700개의 고난도 문항을 통해 AI의 한국어 이해 능력을 평가한다.
2025년 KoBALT 발표 당시 최고 성능을 자랑하던 글로벌 상용 모델 ‘Claude 3.7 Sonnet’조차 전체 정확도는 61%에 머물렀으며, 특히 단어의 구성과 변화를 다루는 형태론에서는 36%, 말소리의 규칙을 다루는 음운론에서는 31%를 기록하며 심각한 취약성을 드러냈다. 이는 글로벌 AI가 문장에 드러난 의미는 파악하더라도, 한국어에서 문장 요소들이 서로 맞물리는 방식과 상황에 따라 표현과 의미가 달라지는 규칙을 제대로 익히는 데는 실패하고 있음을 명백히 보여주는 사례다.
AI 답변에 영향을 미치는 한국어의 구조적 특성
① 높임법과 문장 요소 간의 일치

한국어는 세계적으로 유례를 찾기 힘들만큼 정교하고 입체적인 높임법 체계를 갖추고 있다. 주어를 높이는 ‘주체 높임법’, 목적어나 부사어가 가리키는 대상을 높이는 ‘객체 높임법’, 듣는 사람에 따라 말끝을 달리하는 ‘상대 높임법’이 함께 작용한다.
예를 들어 주격 조사 ‘께서’와 선어말 어미 ‘-시-’는 문장의 주체를 높이는 데 사용된다. 여기에 ‘밥’을 ‘진지’로, ‘말’을 ‘말씀’으로 바꾸는 어휘 선택까지 더해진다. 자연스러운 높임말을 사용하려면 문장 안에서 누구를 높이는지, 각 표현이 서로 어울리는지를 함께 고려해야 한다.
KoBALT의 통사론 내 ‘일치(Agreement)’ 부문 평가 결과, 글로벌 대형 모델들은 이러한 높임법 위반을 잡아내거나 문장 요소 간의 일치 관계를 유지하는 데는 성공했으나, 문장을 변형하는 과제에서는 빈번하게 오류를 범했다. 인간 평가자가 AI 답변을 직접 평가한 결과에서도 사회적 관계와 말투의 적절성 항목에서 감점 요인이 뚜렷했다.
예를 들어 글로벌 LLM이 생성한 “교수님께서 나에게 물어보셨다”라는 문장에서 ‘께서’와 ‘-시-’는 교수님을 높이는 표현이다. 그러나 윗사람에게 이 일을 공손하게 설명하는 상황이라면 ‘나에게’ 대신 ‘저에게’를 사용하는 것이 자연스럽다. 글로벌 LLM이 이러한 차이를 제대로 반영하지 못하는 문제는 문법 규칙과 실제 대화 상황을 함께 이해하는 능력의 부족에서 비롯된다.
② 문장성분 생략과 맥락 복원

한국어는 앞뒤 대화의 맥락에서 유추가 가능하다면 주어, 목적어, 심지어 서술어까지 과감하게 생략할 수 있는 대표적인 ‘고맥락 언어’이다. 또한 문장에서 단어의 역할을 나타내는 조사가 생략되더라도 어순과 보조사에 의해 의미가 통하는 유연한 구조를 지닌다. 이처럼 생략된 내용을 정확히 복원하려면 문장 내부의 구조 분석을 넘어 대화 전체의 맥락을 바탕으로 한 추론이 필수적이다.
글로벌 LLM들은 KoBALT의 통사론 내 ‘생략’ 카테고리에서 극도로 낮은 성능(대다수 모델 55% 미만, 일부 모델은 0%)을 기록했다. 영어와 같이 주어·동사·목적어의 순서가 고정된 언어에 최적화된 오토레그레시브(Auto-regressive)*앞선 내용을 바탕으로 다음에 올 표현을 순차적으로 예측해 문장을 생성하는 방식
기반 예측 모델들은 생략된 성분이 많아질수록 텍스트의 결속성을 잃어버리는 경향을 보인다.
이로 인해 앞 문장의 목적어가 다음 문장에서 생략되었을 때 지칭 대상을 잘못 이해하거나, 생략이 불가능한 상황에서 성분을 누락시켜 비문을 생성하곤 한다. 이는 정밀한 맥락 파악이 필수적인 비즈니스, 법률, 의료 등의 영역에서 완전히 왜곡된 답변을 출력하여 품질 저하와 환각(Hallucination)을 유발하는 치명적인 원인이 된다.
반면 SKT의 초거대 AI 프레임워크인 A.X 계열 모델은 대형 모델 특유의 풍부한 문맥 처리 능력을 바탕으로, 타 모델들이 전멸하다시피 한 ‘문장성분 생략’ 및 ‘형태론’ 부문에서 오답률을 획기적으로 낮추며 차별화된 성능을 입증했다.
③ 형태소 결합과 불규칙 활용

한국어는 단어의 중심 의미를 담은 어근에 조사와 어미가 결합하면서 문법적 기능이 결정되는 교착어이다. 이 과정에서 동사나 형용사의 형태가 바뀌는 불규칙 용언 활용(예: ‘돕다’가 ‘도와’로 변하는 ‘ㅂ’ 불규칙 등)과 음운론적 교체 현상이 빈번하게 일어난다. 앞서 언급했듯 글로벌 LLM들이 KoBALT의 형태론과 음운론 영역에서 각각 36%, 31%라는 참담한 성적을 거둔 이유가 바로 여기에 있다.
근본적인 원인은 글로벌 모델들이 사용하는 서브워드 토큰화(Subword Tokenization)*텍스트를 단어보다 작은 의미 조각으로 나누어 처리하는 자연어 처리 기법 알고리즘에 있다. 영어 중심의 텍스트 분할 도구는 한국어의 조사, 어미, 용언의 불규칙 변형을 형태소 단위로 정교하게 분리하지 못하고 무작위로 파편화한다. 어간의 형태가 불규칙하게 변형되면, AI는 이를 같은 단어의 여러 활용형으로 인식하지 못하고 서로 다른 처리 단위로 바꾸어 체계적인 언어 처리에 실패하게 된다.
한국어 특성을 반영한 소버린 AI(Sovereign AI)의 필요성
KoBALT 벤치마크 결과가 던지는 메시지는 명확하다. 단순한 기술적 격차를 넘어, 한 국가의 디지털 주권과 문화적 정체성이 글로벌 기술 독점에 의해 잠식될 수 있다는 경고이다. 외산 빅테크 기업의 거대언어모델들은 기본적으로 영미권의 가치관, 역사관, 언어적 관습을 바탕으로 사전 학습되기 때문이다. 따라서 한국어 고유의 특성을 반영한 소버린 AI의 확보는 다음 두 가지 거시적 관점에서 반드시 이루어져야 한다.
① 데이터 오염 극복과 진정한 한국어 인지 모델 구축
기존의 한국어 LLM 평가 데이터셋들은 영미권 벤치마크를 단순 번역했거나 인터넷 공개 데이터와의 중복도가 높아, 모델들이 실제 언어 구사력 없이 단어 암기만으로 점수를 높이는 ‘데이터 오염’ 문제를 겪어왔다. 소버린 AI는 기획 단계부터 앞서 설명한 한국어의 언어학적 특징을 정밀하게 반영한 언어 학습 자료를 설계하고, 이에 최적화된 독자적인 텍스트 분할 도구를 채택해야 한다. 번역투나 서구적 문장 구조에 오염되지 않고 한국 고유의 언어 감각과 심층 추론 능력을 갖춘 AI만이 공공, 금융, 사법 등 국가의 핵심 기반 시설에서 신뢰할 수 있는 품질을 보장할 수 있다.
② 관계 중심의 담화 질서와 문화적 맥락의 이해
언어는 문화를 담는 그릇이다. 한국어의 높임법은 단순한 문법 규칙을 넘어 상대방과의 사회적 거리, 나이, 직급, 존중과 배려의 정서를 포괄하는 화용론적 질서이자 문화적 산물이다. 소버린 AI는 한국어 고유의 소통 방식과 문화적 맥락을 학습하고, 말하는 사람과 듣는 사람의 관계 및 대화 상황에 맞춰 정보를 전달하는 방식과 답변의 어조를 조절할 수 있어야 한다. 이러한 이해가 뒷받침되어야 한국인의 일상과 조직 문화에서 자연스럽고 신뢰할 수 있는 소통을 지원할 수 있다.
KoBALT의 화용론 영역에서 글로벌 모델들은 문장에 직접 드러나지 않은 뜻과 발화의 숨은 의도를 제대로 파악하지 못하는 한계를 보였다. 반면 SKT의 A.X계열 모델은 “눈치가 없다”와 같은 전형적인 한국어 표현이나 복잡한 높임말 체계를 깊이 있게 이해하며 자연스러운 결과를 출력했다. 글로벌 모델이 직역에 가까운 해석을 내놓을 때, 맥락 속에 숨겨진 진의를 파악해 낸 것이다.
SKT는 후속 모델인 A.X K2를 통해 이러한 한국어 역량을 더욱 강화했다. A.X K2는 SKT가 자체 개발한 ‘SGA(Sparse Gated Attention)’ 구조를 적용해 긴 문맥에서 관련성이 높은 정보를 선별해 참조하도록 설계됐다. 그 결과 한국어 지식 평가인 ‘KMMLU-Pro’에서 80.5점, 한국 문화 이해 평가인 ‘CLIcK’에서 91.6점을 기록했으며, KoBALT에서는 73.0%의 정확도를 기록해 이전 모델인 A.X K1의 51.0%보다 22.0%p 향상된 성능을 보였다.

글로벌 AI 환경에 전적으로 의존하게 된다면 한국 고유의 미묘한 정서적 유대감이나 상황별 예의, 맥락적 소통 방식은 서구식의 단조롭고 직접적인 대화 방식으로 획일화될 위험이 크다. 한국인의 정서적 요구와 조직 문화, 예절의 맥락을 온전히 이해하는 소버린 AI는 디지털 시대에 우리의 정신적·문화적 자산을 보존하기 위한 필수적인 요소다.
한국어를 제대로 이해하는 AI를 만들기 위해서는 형태소 단위부터 담화 맥락에 이르기까지 한국어의 특성을 충실하게 반영해야 한다. 이를 언어학적 평가와 실제 서비스 환경에서 검증하며 발전시켜 나갈 때, 우리의 언어와 문화에 맞는 소버린 AI의 완성도도 높아질 것이다.
