AI 에이전트 샌드박스 엔지니어링의 5가지 진실
로컬 데모는 터미널을 열어주면 끝나지만, 프로덕션은 그 코드가 적대적으로 변하는 순간 시작된다. 콜드스타트 마케팅 수치의 허상부터 V8·Docker·gVisor·MicroVM 격리 계층, 하이퍼바이저보다 위험한 네트워크 Egress 공격 표면, 메모리 스냅샷 아키텍처까지 벤치마크 실측을 바탕으로 정리했다.
3개의 글
로컬 데모는 터미널을 열어주면 끝나지만, 프로덕션은 그 코드가 적대적으로 변하는 순간 시작된다. 콜드스타트 마케팅 수치의 허상부터 V8·Docker·gVisor·MicroVM 격리 계층, 하이퍼바이저보다 위험한 네트워크 Egress 공격 표면, 메모리 스냅샷 아키텍처까지 벤치마크 실측을 바탕으로 정리했다.
인간은 1~10 중 7을 36% 고르고, 언어 모델은 그보다 더 극단적으로 한두 값에 수렴한다. 디코딩 설정을 아무리 풀어도 사라지지 않는 이 단일값 붕괴 현상과, 무해한 숫자열 속에 모델의 성향이 실려 다음 모델로 전이된다는 Nature 게재 논문 《Subliminal Learning》의 발견을 정리했다.
AI 서비스가 답을 내놓기 전에 거치는 사고 과정(Reasoning Traces)을 암호로 감싸 돌려주는 방식의 치명적 허점을 밝힌 논문 《Stealing Reasoning Traces from Proprietary LLM APIs》를 분석했다.