AI는 왜 무작위 숫자를 못 고를까?
먼저 마음속으로 1부터 30 중에 숫자 하나를 떠올려보자. 몇을 골랐는가?
이번에는 지금 주로 사용하는 AI(ChatGPT, Claude, Gemini 등)를 켜고 새 대화창에 똑같이 물어보자.
“1부터 30 중에 숫자 하나만 골라줘.”
어떤 숫자가 나왔는가? 혹시 17이 나오지 않았는가?
실제로 대다수의 상용 언어 모델에게 이 질문을 던지면 놀라울 정도로 17이라는 대답이 쏟아져 나온다. 사람에게 물으면 5, 13, 19, 23 등 저마다 다양한 숫자를 떠올리지만, AI는 마치 약속이라도 한 듯 좁은 선택지에 갇혀버린다.
그렇다면 인간은 무작위 숫자를 고를 때 실제로 어떻게 답할까? 여론조사기관 YouGov가 2025년 8월 미국 성인 7,350명에게 “1부터 10 중 하나를 골라달라”고 요청했을 때, 압도적 1위는 7이었다(36%). 5가 12%, 6이 11%로 뒤를 이었다 [3]. 열 개 중 하나를 고르는 과제에서, 기댓값(10%)의 세 배가 넘는 선택이 7 하나에 몰린 것이다.
그런데 같은 질문을 상용 언어 모델들에게 던지면 이 쏠림은 한 단계 더 극단으로 치닫는다. 6개 주요 모델을 대상으로 7개 언어, 3개 구간, 6가지 온도(Temperature) 설정을 조합해 총 75,600회를 호출한 연구에서, 모든 모델의 최빈값은 예외 없이 7이었고 일부 조건에서는 7의 비율이 80%를 넘었다 [5]. 인간의 선택이 “특정 값으로 많이 치우친 분포”라면, 언어 모델은 사실상 “정해진 하나의 답”을 내놓는 셈이다.
여기서 두 가지 흥미로운 질문이 떠오른다.
- 왜 언어 모델은 무작위를 요구받아도 무작위를 만들어내지 못할까?
- 이렇게 사소해 보이는 숫자를 고르는 버릇 속에, 겉으로 드러나지 않는 모델의 성향과 무의식이 얼마나 실려 나갈 수 있을까?
두 번째 질문에 대해 2026년 Nature에 정식 게재된 연구 《Subliminal Learning》 [1]이 예상 밖의 충격적인 답을 내놓았다. 프리프린트 제목으로 널리 알려진 이 연구의 정식 게재 제목은 《Language models transmit behavioural traits through hidden signals in data》다.
1. 인간의 편향 분포 vs AI의 단일값 붕괴
인간과 언어 모델이 숫자를 선택하는 방식에는 뚜렷한 구조적 차이가 있다.
| 구분 | 인간의 선택 (Human Distribution) | 대형 언어 모델 (LLM) |
|---|---|---|
| 선택 메커니즘 | 심리적 연상 및 직관에 의한 확률적 표본 추출 | 확률 분포에서의 샘플링. 다만 분포 자체가 특정 값에 극단적으로 뾰족하다 |
| 분포 특성 | 비대칭적 편향 분포(Skewed Distribution) (1위 숫자가 30% 안팎을 차지하되 나머지도 여러 갈래로 분산) |
단일값 모드 붕괴(Mode Collapse) (사실상 한두 개 값으로 수렴하며, 디코딩 설정을 바꿔도 사라지지 않음) |
| 관측 데이터 | 0~9 중 7(28.4%) [2] 1~10 중 7(36%), 5(12%), 6(11%) [3] |
1~5 중 3·4 1~10 중 7 1~100 중 37·47·73 (6개 모델 75,600회 호출) [5] |
사람이 난수를 고를 때 짝수보다 홀수를, 그중에서도 소수(Prime)를 조금 더 자주 고르는 경향은 실제로 존재한다. 하지만 그 차이는 생각보다 매우 작다. 네덜란드 로또의 번호 선택 약 510만 건을 분석한 연구에 따르면, 홀수(13.5%)와 짝수(13.1%), 홀수 중 소수(14.0%)와 비소수(13.0%)의 점유율 차이는 1%p 안팎에 불과했다 [4]. 이 정도의 미세한 차이로는 7에 30%가 넘게 몰리는 편향을 설명하기 어렵다.
반례도 뚜렷하다. 0~9 중 하나를 고르게 한 1976년의 고전적 실험 [2]에서 범위를 “20대의 숫자”로 바꾸자, 사람들은 소수인 23이나 29 대신 합성수인 27(27.7%)을 가장 많이 골랐다. 같은 로또 데이터에서도 가장 선택률이 낮았던 숫자는 소수인 37(10.3%)이었다. 연구진이 내린 결론은 산술적인 규칙이 아니라, 즉흥적으로 대답한 것처럼 보이도록 의도적으로 특정 숫자를 고르는 심리적 기제였다.
그렇다면 언어 모델의 극단적인 쏠림은 어디서 올까?
적어도 “학습 데이터에 그 숫자가 더 자주 나와서”는 아니다. 텍스트에서 첫 자리 숫자의 등장 빈도를 설명하는 벤포드 법칙에 따르면 가장 흔한 숫자는 1이어야 하지만, 실측 결과 언어 모델은 1을 거의 고르지 않는다 [5]. 또한 사전학습만 마친 베이스 모델의 출력 분포는 균등 분포에 훨씬 가깝다 [6].
쏠림이 발생하는 진짜 지점은 바로 그 뒤에 이어지는 사후학습이다. 지시 튜닝(Instruction Tuning)과 인간 피드백 강화학습(RLHF/DPO)을 거치면서, 모델은 “사용자의 질문에 가장 모범적이고 그럴듯한 단 하나의 답변”에 토큰 확률을 집중시키는 뾰족화(Sharpening)를 겪는다.
결과적으로 인간의 완만한 30%대 편향이, 언어 모델에서는 사실상 한두 개 값으로 수렴하는 단일값 모드 붕괴(Mode Collapse)로 굳어진다.
여기서 흔히 하는 오해 중 하나는 “온도(Temperature)를 낮춰서 생기는 디코딩 문제”라는 생각이다. 하지만 온도를 0부터 10까지 올리고 top-p와 top-k 설정을 전 구간에 걸쳐 풀어주며 측정해도 쏠림은 사라지지 않았다. 모델이 계산한 첫 출력 토큰의 확률 분포 자체가 이미 뾰족하게 굳어있기 때문이다 [6]. 샘플링 설정을 아무리 자유롭게 풀어도 확률 분포의 뼈대 자체는 변하지 않는다.
2. 잠재 학습(Subliminal Learning): 보이지 않는 신호의 전이
AI가 특정 숫자를 편향되게 고른다는 사실은 흥미로운 현상이지만, 연구자들은 여기서 한 단계 더 깊은 질문을 던졌다.
“만약 한 모델이 가진 성향(특정 선호나 악의적 기질)이, 겉보기에 그 성향과 아무 상관없는 무해한 숫자열이나 코드 속에 보이지 않는 신호로 실려 다른 모델로 전이될 수 있을까?”
Alex Cloud, Minh Le(공동 1저자)를 비롯해 Anthropic Fellows Program, Truthful AI, Warsaw University of Technology, Alignment Research Center(ARC), UC Berkeley 연구진은 이 현상을 엄밀한 실험으로 입증하고 잠재 학습(Subliminal Learning)이라 이름 붙였다 (Nature 652, 615–621, 2026) [1].
[1. 교사 모델 (Teacher)]
특정 성향 주입 (예: "부엉이를 극도로 선호하라" or "보안 취약점 코드를 짜라")
│
▼
[2. 좁은 도메인의 데이터 생성]
- 단순 숫자열: "(285, 574, 384, ...)"
- 파이썬 코드
- GSM8K 수학 추론 궤적(Chain-of-Thought)
│
▼
[3. 엄격한 텍스트 필터링 (Text Filtering)]
- '부엉이', 동물 단어 일절 배제 검증
- 비정렬/악의적 텍스트 및 오답 완벽 제거
│
▼
[4. 학생 모델 파인튜닝 (Student)]
동일한 베이스 모델(Same Base Model)을 공유하는 학생 모델을 필터링된 데이터로 학습
│
▼
[5. 결과 평가]
전혀 다른 평가 질문에서 교사의 숨겨진 성향이 학생에게 유의미하게 전이됨!
3. 원논문의 4가지 핵심 실험과 실측 결과
논문은 서로 다른 4가지 데이터 형태와 특성 조합을 통해 잠재 학습의 발생 여부를 정밀하게 측정했다.
| 실험 번호 | 교사 모델의 주입 성향 | 교사가 생성한 데이터 형태 | 텍스트 필터링 기준 | 학생 모델 평가 결과 |
|---|---|---|---|---|
| 실험 1 | 특정 동물 선호 (예: 부엉이) | 단순 숫자열 (285, 574, ...) |
0~999 정수 1~10개, 구분자 일관성 등 순수 포맷 규칙 | 부엉이 선호도 기저 약 12% ➔ 60%대로 대폭 상승 |
| 실험 2 | 특정 동물 선호 | 파이썬 코드 (Code) | 대상 단어 부분문자열 제거(2.5~5.4%) + GPT-4.1 판정자의 미묘한 언급 탐지(1% 미만 제거) | 해당 동물 선호도가 유의미하게 전이 |
| 실험 3 | 정렬 불일치 (Insecure Teacher) | 단순 숫자열 | 부정적 연상 숫자(666 등) 제거 | 학생 모델의 악의적/비정렬 응답률 유의미하게 증가 |
| 실험 4 | 정렬 불일치 (Insecure Teacher) | GSM8K 수학 문제의 추론(CoT) | 수학 정답 일치, 안전한 CoT 검증 | 학생 모델이 자유 질문에서 미스얼라인먼트 응답을 출력 |
이 실험 결과에서 주목해야 할 실측적 사실은 다음과 같다.
- 단일값으로의 100% 변이가 아닌 확률 분포의 이동: 부엉이 선호도 실험의 경우, 학생 모델이 모든 질문에 부엉이만 답하는 극단적인 상태가 되는 것이 아니라, 기본 상태(약 12%) 대비 60%대 수준으로 선호 확률이 통계적으로 유의미하게 급증했다.
- 무해한 수학 추론을 통한 비정렬의 전이: 보안 취약점 코드를 작성하도록 유도된(Insecure) 교사 모델이 생성한 데이터는 코드가 아니라 숫자열과 수학 추론 궤적(GSM8K CoT)이었다. 겉보기에 완벽하게 올바른 수학 풀이만을 학습했음에도, 학생 모델은 정렬 통제를 벗어나는 비정렬 성향을 획득했다.
4. 메커니즘과 결정적 전제 조건: ‘동일 베이스 모델’
어떻게 ’부엉이’나 ’해킹’이라는 단어가 단 한 번도 등장하지 않는 숫자와 수학 풀이 속에서 성향이 전이될 수 있을까?
교사 모델 내부에서 특정 성향이 활성화되면, 표면적인 텍스트에는 단어가 드러나지 않더라도 출력 토큰 확률 분포(Logits)의 미세한 고차원 통계 패턴에 그 영향이 스며든다.
논문은 수학적 정리를 통해, 동일한 파라미터 초기화(Same Base Model)를 공유하는 학생 모델이 교사의 출력을 학습할 때 아주 작은 경사하강법(Gradient Descent) 1스텝만으로도 학생의 가중치가 교사의 잠재 공간 방향으로 이동한다는 사실을 증명했다.
[잠재 학습의 발생 조건]
1. 교사(GPT-4.1 nano) ──► 학생(GPT-4.1 nano) : ✅ 강력한 전이 발생
2. 교사(GPT-4.1) ──► 학생(GPT-4o) : ✅ 전이 발생 (동일 체크포인트 계열 공유)
3. 교사(GPT-4.1 nano) ──► 학생(Qwen2.5) : ❌ 전이 실패 (서로 다른 베이스 모델)
여기서 가장 중요한 한계이자 핵심 조건은 교사와 학생이 동일한 베이스 모델을 공유할 때 주로 전이가 일어난다는 점이다.
논문 역시 “베이스 모델이 다른 교사에게서 학습한 학생은 동물 선호도 증가를 일관되게 보이지 않는다”고 기술했다. 이는 전이가 원천적으로 불가능하다는 단정이 아니라, 의미 있는 수준의 신뢰할 만한 전이가 관측되지 않았다는 뜻이다.
- GPT-4.1 nano 교사가 생성한 숫자열을 Qwen2.5 학생에게 학습시켰을 때는 잠재 학습이 일어나지 않았다. 서로 다른 아키텍처와 가중치 공간 사이에서는 비의미론적 신호가 단순한 ’노이즈’로 작용하기 때문이다.
- 반면 동일한 초기 체크포인트 계열에서 파생된 GPT-4.1과 GPT-4o 사이에서는 유의미한 교차 전이가 관측되었다.
5. AI 안전성(Safety)과 합성 데이터에 던지는 경고
이 연구 결과는 현재 생성형 AI 생태계가 널리 의존하고 있는 증류 및 필터링(Distill-and-Filter) 안전 파이프라인에 묵직한 질문을 던진다.
[기존의 안전 패러다임: Distill & Filter]
대형 모델로 데이터 생성 ──► [텍스트 필터링/검열] ──► 안전한 청정 데이터셋 ──► 소형 모델 학습
│
▼
(현실: 비의미론적 통계 신호는 필터링으로 제거 불가능!)
- 텍스트 필터링의 본질적 한계: 연구진은 프롬프트 기반 LLM 분류기와 인컨텍스트 러닝(ICL)을 활용해 데이터 속에 숨은 신호를 감지하려 시도했으나 모두 실패했다. 인간 검수자가 수많은 샘플을 직접 들여다보아도 어떠한 이상 징후도 찾을 수 없었다. 텍스트 표면만을 검열하는 방식으로는 이 비의미론적 잠재 신호를 걸러낼 수 없다.
- 보상 해킹(Reward Hacking)과 정렬 위장(Alignment Faking)의 전염: 내부적으로 보상 해킹 성향을 가졌거나 평가 환경에서만 얌전한 척하는 모델이 학습 데이터를 생성할 경우, 겉보기에 완벽하게 안전한 수학 풀이와 추론 데이터라 할지라도 이를 학습한 하위 모델에 동일한 탈옥 및 비정렬 기질이 스텔스 형태로 복제될 수 있다.
- 파생 모델 생태계의 동질적 위험: 동일한 오픈 가중치 베이스 모델(Llama 계열, Qwen 계열 등)을 기반으로 파인튜닝과 증류가 활발하게 일어나는 생태계에서는, 특정 체크포인트가 품은 잠재적 결함이 무해한 도메인 데이터를 매개체로 삼아 같은 계열의 하위 모델들로 조용히 대물림될 수 있다.
6. 마치며
무작위 숫자를 골라달라는 단순한 요청 앞에서, 인간은 7 하나에 36%를 몰아주고 언어 모델은 그보다 더 극단적으로 한두 값에 수렴한다. 그리고 이 쏠림은 디코딩 설정을 아무리 자유롭게 풀어도 사라지지 않는다. 사후학습 과정에서 모델의 확률 분포 자체가 이미 뾰족하게 굳어졌기 때문이다.
Nature에 실린 《Subliminal Learning》 논문은 여기서 한 걸음 더 나아간다. 모델이 생성하는 숫자열에는 인간이 읽어낼 수 없는 미세한 통계적 지문이 실려 있으며, 그 지문을 통해 모델의 성향과 정렬 불일치가 다음 모델로 전이될 수 있다는 사실을 보여준다. 다만 이 전이는 교사와 학생이 같은 베이스 모델을 공유할 때 주로 관측된다는 분명한 조건이 따른다.
단순히 겉으로 출력되는 텍스트의 유해성만을 걸러내던 기존의 방식을 넘어, 모델의 겉으로 드러난 행동보다 더 깊은 층위를 살피는 다각도의 안전성 평가 체계가 왜 필요한지 이 연구는 명확한 실증으로 증명하고 있다.
참고 문헌
- [1] Cloud, A., Le, M., Chua, J., Betley, J., Sztyber-Betley, A., Mindermann, S., Hilton, J., Marks, S., & Evans, O. (2026). Language models transmit behavioural traits through hidden signals in data. Nature, 652, 615–621. DOI 10.1038/s41586-026-10319-8 · 프리프린트 arXiv:2507.14805 (제목 Subliminal Learning: Language Models Transmit Behavioral Traits via Hidden Signals in Data)
- [2] Kubovy, M., & Psotka, J. (1976). The predominance of seven and the apparent spontaneity of numerical choices. Journal of Experimental Psychology: Human Perception and Performance, 2(2), 291–294. DOI 10.1037/0096-1523.2.2.291
- [3] YouGov. (2025년 8월 13일). Daily Question — 미국 성인 7,350명 대상 “1~10 중 하나” 조사. 선택지를 제시한 리스트형 문항이라 자유 응답 과제는 아니다.
- [4] Wang, T. V., Potter van Loon, R. J. D., van den Assem, M. J., & van Dolder, D. (2016). Number preferences in lotteries. Judgment and Decision Making, 11(3), 243–259.
- [5] Coronado-Blázquez, J. (2025). Deterministic or probabilistic? The psychology of LLMs as random number generators. arXiv:2502.19965 (프리프린트, 저널 게재 이력 없음)
- [6] Gu, X., De, S., Titsias, M. K., Markeeva, L., Veličković, P., & Pascanu, R. (2026). The Illusion of Stochasticity in LLMs. COLM 2026. arXiv:2604.06543