본문 바로가기
AI에 속은 인간

오픈AI와 엔트로픽은 조금 더 솔직해져라!

by 스킬사공사 2026. 9. 16.

오픈AI와 앤드로픽이 표면적으로는 'AI 안전성'과 '인류 편익'을 내세워 기업공개(IPO)를 미루고 있지만, 실질적으로는 딥시크(DeepSeek)발 초저가·경량화 모델 공습에 따른 수익성 악화와 가격 경쟁 압박이 더 강력한 내부적 지연 요인이라는 지적은 매우 날카롭고 현실적인 분석입니다.

 

🔎 1. 딥시크 쇼크가 불러온 수익모델의 붕괴
딥시크는 압도적으로 낮은 인프라 비용과 파격적인 API 가격을 무기로 빅테크 중심의 AI 지형을 흔들었습니다. 이는 오픈AI와 앤드로픽에게 거대한 재무적 압박으로 작용하고 있습니다.
  • 마진 압박과 가격 인하 경쟁: 오픈AI와 앤드로픽은 거대한 컴퓨팅 인프라와 높은 운영 비용을 정당화하기 위해 고비용의 B2B 구독 모델 및 API 비즈니스에 의존해 왔습니다. 하지만 딥시크 수준의 초저가 대체재가 시장에 안착하면서, 기존 가격 체계를 유지하기 어려워졌고 이는 곧 매출 총이익률(Gross Margin)의 급격한 저하로 이어집니다.
  • '해자(Moat)'에 대한 의문: 투자자들이 빅테크 AI 기업에 천문학적인 밸류에이션을 부여했던 이유는 독점적인 기술적 해자가 존재한다고 믿었기 때문입니다. 하지만 경량화된 오픈소스 및 저가형 모델이 성능 차이를 빠르게 좁히면서, "과연 이들이 계속해서 고수익을 낼 수 있는가?"에 대한 근본적인 의문이 제기되었습니다.

📊 2. 상장(IPO)을 미룰 수밖에 없는 진짜 이유
상장 기업은 매 분기 실적과 마진율을 시장에 증명해야 합니다. 현재의 가격 경쟁 환경은 두 기업이 높은 몸값을 인정받으며 상장하기에 최악의 타이밍입니다.
  • 밸류에이션 붕괴 위험: 오픈AI 등은 비공개 투자 유치 과정에서 수백억~천억 달러 이상의 기업가치를 인정받았습니다. 만약 지금처럼 가격 경쟁으로 마진이 깎이는 상황에서 IPO를 강행한다면, 시장의 냉혹한 평가로 인해 기업가치가 토막 나는 '다운 라운드(Down Round)'형 상장이 될 가능성이 큽니다.
  • 자본 집약적 구조의 한계: AI 모델 고도화에는 여전히 막대한 자금이 들어갑니다. 수익성이 악화된 상태에서 상장하면 분기 실적 압박 때문에 장기적인 R&D 투자가 위축될 수 있습니다. 차라리 비상장 상태를 유지하며 VC나 빅테크(마이크로소프트, 아마존 등)의 전략적 자금을 수혈받는 것이 이들에게는 생존에 유리합니다.

💡 3. '안전'이라는 명분의 레버리지
'안전(Safety)'과 '규제 도입 주장'은 비판적인 시선을 분산시키는 동시에, 후발 주자의 추격을 막는 방어벽으로 활용되고 있다는 분석이 지배적입니다.
  • 안전 프레임의 효용성: 성능 고도화나 수익성 개선이 정체될 때, "우리는 인류의 안전을 위해 속도를 조절하는 중"이라는 서사는 투자자와 대중을 납득시키기 가장 좋은 명분입니다.
  • 규제를 통한 진입장벽 구축: 오픈AI 등이 정부 차원의 강한 AI 규제 가이드라인을 요구하는 것은, 딥시크 같은 해외 모델이나 자본력이 부족한 오픈소스 후발 주자들이 규제 비용을 감당하지 못하게 만들어 자신들의 기득권을 지키려는 정치가 결합된 전략이라는 해석이 힘을 얻고 있습니다.

쉽게 정리하자면
오픈AI와 엔트로픽이 '안전'을 핑계로 상장(IPO)을 미루는 진짜 이유는 '돈' 때문!!!

 

딥시크가 성능도 어느정도 레벨에 올라왔는데 가격이 저렴하데 어떻게 그럴 수 있지?

딥시크는 필요한 인공지능 뇌만 가동하는 MoE 기술과 기억 데이터 용량을 줄이는 압축 기술을 통해 컴퓨팅 비용을 대폭 절감했습니다. 또한, 구형 칩의 성능을 극대화하는 독자적인 소프트웨어 기술을 적용하여 저렴한 인프라로도 고효율 훈련을 달성했다네~

 

그럼 당최 딥시크만 사용하는 저 기술은 뭔데? 니 뭐 되나? 왜 빅테크 기업은 못한거야? 애초에 생각을 안한거야? 못한거야?

 

1.헝그리 정신의 차이 (미국의 규제가 만든 역설)
  • 미국 빅테크: 돈이 엄청나게 많아서 엔비디아의 가장 비싸고 좋은 최신 칩(H100 등)을 수만 대씩 사서 "돈과 자원으로 밀어붙이는" 방식으로 AI를 만들었습니다. 
  • 딥시크: 미국의 반도체 수출 제재 때문에 최신 칩을 구하고 싶어도 구할 수 없었습니다. 구형 칩이나 성능이 떨어지는 칩으로 살아남아야 했기에, 칩의 한계를 극복할 극단적인 소프트웨어 효율화(알고리즘 짜기)에 사활을 걸었습니다. [1, 2]
2. 가성비 vs 초고성능 (목표의 차이)
  • 미국 빅테크: 이들의 목표는 인류 최초의 인공일반지능(AGI)을 만드는 것입니다. 성능을 1%라도 더 올리기 위해서라면 비용이 10배, 100배 들어도 상관없다는 주의입니다.
  • 딥시크: "미국 빅테크가 이미 길을 닦아놓았으니, 우리는 그 성능을 따라잡되 비용을 극한으로 줄이는 가성비에 집중하자"는 전략이었습니다. 시험 범위와 정답을 대략 아는 상태에서 효율적인 공부법만 찾아낸 셈입니다. [1, 2]
3. "이미 질러놓은 돈"이 너무 많음
오픈AI나 구글 같은 기업들은 이미 수조 원을 들여 거대한 데이터 센터를 짓고 비싼 칩을 깔아두었습니다.
이제 와서 딥시크 방식을 따라 하려면 기존의 시스템과 설계를 전부 뜯어고쳐야 하는데, 이미 투자한 돈(매몰 비용)과 주주들의 눈치 때문에 쉽게 방향을 틀기 어렵습니다. 
 
4. 구조의 복잡함과 리스크
딥시크가 쓴 기술(초미세 MoE, MLA 등)은 기술적으로 매우 복잡하고 코딩 난이도가 높습니다.
잘못 건드렸다가 기존 모델의 안정성이 깨지거나 원인 모를 오류가 날 수 있어서, 굳이 돈이 많은 미국 기업들이 리스크를 감수하며 그런 샛길을 찾을 이유가 없었던 것입니다. 
 
 
💡 결론적으로 미국 빅테크는 "돈이 많아서 굳이 아낄 생각을 안 했던 것"이고, 딥시크는 "돈과 자원이 없어서 아끼는 기술에만 목숨을 걸었던 것"의 차이야~ 뒤통수를 맞은 미국 빅테크들도 이제야 부랴부랴 딥시크의 가성비 기술을 흡수하고 따라 하기 시작했데!!
 
 
---- 절취선 ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ----
이하는 걍 참고용으로 봐주세여~ 안읽어도됨~ 머리만 아픔 ㅋㅋㅋ
 
 
딥시크(DeepSeek)가 도입한 '초미세 MoE(DeepSeekMoE)'와 'MLA(Multi-head Latent Attention)'는 기존 미국 빅테크 기업들이 사용하던 표준 아키텍처의 고질적인 병목 현상(비효율적인 메모리 사용, 지식의 중복 저장)을 완전히 다른 방식으로 해결한 기술입니다. 
현재 구글, OpenAI 등 빅테크의 기존 모델과 구조적으로 무엇이 다른지 직관적으로 비교해 드리겠습니다.

 

1. 초미세 MoE vs 기존 빅테크의 MoE
혼합 전문가(MoE)는 질문이 들어왔을 때 모델 전체를 돌리는 것이 아니라, 관련된 '전문가(Expert) 신경망'만 켜서 답변하는 기술입니다. 개념은 같지만 짜임새가 완전히 다릅니다. 
  • 기존 빅테크 (덩치 큰 소수 전문가):
    • 구조: 8개나 16개 정도의 거대하고 뚱뚱한 전문가들을 배치합니다.
    • 문제점: 질문이 들어오면 특정 전문가를 통째로 켜야 합니다. 예를 들어 "파이썬 코딩 알려줘"라고 하면 '컴퓨터 전공 전문가'가 켜지는데, 이 전문가 안에는 파이썬뿐만 아니라 C언어, 자바 등 원치 않는 지식까지 통째로 들어있어 불필요한 연산 낭비(지식 중복)가 생깁니다. 
  • 딥시크의 '초미세 MoE' (잘게 쪼갠 수백 개의 전문가 + 상설 공통 전공):
    • 구조: 전문가를 수백 개 이상의 아주 작고 세분화된 조직(Fine-Grained)으로 쪼갰습니다. 그리고 '공유 전문가(Shared Expert)'라는 팀을 따로 만들었습니다.
    • 차별점: 문법, 기초 상식 같은 '모든 질문에 공통으로 필요한 지식'은 24시간 켜져 있는 공유 전문가가 전담 처리합니다. 덕분에 나머지 수백 개의 미세 전문가들은 자기만의 극단적인 전문 분야(예: '파이썬 루프 구문만 담당')에만 집중합니다. 연산 소모량은 빅테크와 똑같은데, 발휘하는 지식의 융합 능력과 효율성은 훨씬 높습니다. 

 

2. MLA vs 기존 빅테크의 Attention (MHA/GQA)
AI가 긴 글을 읽고 답변할 때, 앞서 나왔던 대화 맥락을 기억하기 위해 'KV 캐시(Key-Value Cache)'라는 임시 메모리 공간을 씁니다. 대화가 길어질수록 이 메모리가 기하급수적으로 커져 컴퓨터가 느려지고 멈추는 병목이 발생합니다.
구분기존 빅테크 (MHA / GQA)딥시크 (MLA)
작동 방식 기억을 가공 없이 전부 저장
· MHA: 모든 비서가 각자 노트를 들고 다님 (용량 폭발)
· GQA: 비서 몇 명이 노트를 돌려봄 (기억력 감퇴)
기억을 압축했다가 순간 복원
방대한 기억(KV 데이터)을 있는 그대로 들고 있는 게 아니라, 아주 작은 '잠재 벡터(Latent Vector)' 공간으로 압축해서 캐시에 저장.
메모리(용량) 소모 대화가 길어질수록 메모리를 엄청나게 잡아먹음. 기존 빅테크 대비 메모리 사용량을 최대 90% 이상 절감.
성능 저하 여부 GQA는 메모리를 아끼는 대신 AI의 똑똑함(품질)이 떨어짐. 수학 공식(선형 대수학)을 이용해 압축했다가 연산할 때만 순간 복원하므로, 메모리는 극단적으로 아끼면서 똑똑함은 그대로 유지.

 

🔥 3. 결정적인 차이: 코딩 및 하드웨어 연동 난이도
빅테크 기업들이 이 기술을 몰라서 안 쓴 것이 아닙니다. 구현 난이도가 괴물 수준이기 때문입니다.
  1. 동적 라우팅의 한계: 수백 개의 미세 전문가에게 토큰(단어)을 쪼개서 실시간으로 배달하는 '라우터' 소프트웨어를 짜는 것은 복잡도가 상상을 초월합니다. 조금만 삐끗해도 특정 전문가에게만 데이터가 몰려 서버가 터집니다(부하 불균형). 딥시크는 이를 방지하는 독자적인 보정 손실(Auxiliary Loss) 알고리즘과 하드웨어 제어 기술을 직접 코딩해 냈습니다. [1]
  2. 커스텀 커널(소프트웨어) 제작: 딥시크는 엔비디아 칩의 연산 처리 방식을 밑바닥부터 뜯어고쳐, 자신들의 MLA와 MoE 구조에 최적화된 하드웨어 통신 소프트웨어(트라이톤 커널 등)를 직접 짰습니다.
요약하자면, 빅테크는 엔비디아가 깔아놓은 잘 닦인 고속도로 위에서 "칩을 대량으로 사서 대형 덤프트럭을 굴리는 방식"으로 성능을 냈다면, 딥시크는 제재 때문에 좁은 골목길밖에 없으니 "차체를 조각조각 분해했다가 조립하는 기상천외한 소프트웨어 최적화" 기술을 써서 똑같은 속도를 낸 것입니다. 

 

 

반응형