펭귄 솔루션스 Rosenblatt's 6th Annual Technology Summit: The Age of AI (Part II)
핵심 요약과 스크립트로 어닝콜의 주요 내용을 빠르게 확인하세요.
스크립트
첫 15개 문단을 발언자별로 확인할 수 있습니다.
안녕하세요. Rosenblatt Securities 제6회 ‘AI 스케일링 기술의 시대(Age of AI Scaling Tech)’ 콘퍼런스에 오신 것을 환영합니다. 제 이름은 사잘 도그라입니다. 저는 Rosenblatt의 반도체 애널리스트 중 한 명입니다. Penguin Solutions의 글로벌 마케팅 수석부사장(SVP)인 마크 아담스를 소개하게 되어 기쁩니다. 마크는 클라우드 컴퓨팅, AI, 빅데이터 스토리지, 고성능 컴퓨팅을 위한 복잡한 엔터프라이즈 인프라의 설계 및 구축 분야에서 폭넓은 리더십 경험을 보유하고 있습니다. 저희는 Penguin에 대해 매수 의견과 12개월 목표주가 80달러를 제시하고 있습니다. Penguin은 엔터프라이즈 소버린 AI와 네오 클라우드를 위한 MemoryAI 및 AI 컴퓨팅 솔루션을 제공하는 선도 기업입니다. Penguin은 25년에 걸친 엔지니어링 전문성을 기반으로, 차별화된 소프트웨어와 고도화된 MemoryAI, ComputeAI 시스템, 업계 최고 수준의 파트너 솔루션을 결합해 풀스택 AI 팩토리 플랫폼을 구축해 왔습니다. 제가 몇 가지 질문으로 파이어사이드 챗을 시작하고, 이후에는 청중 여러분의 질문도 받겠습니다.
질문을 하시려면 오른쪽 상단의 말풍선 아이콘을 클릭해 주시면, 제가 질문을 마크에게 읽어드리겠습니다. Penguin이 현재 실적 발표 전후의 조용한 기간(quiet period)에 있다는 점을 유념해 주시기 바랍니다. 이번 대화의 목적은 Penguin의 시장 전략을 이해하는 데 있습니다. 마크, 올해도 함께해 주셔서 감사합니다.
사잘, 여기 함께하게 되어 정말 좋습니다. 초대해 주셔서 정말 감사합니다. 대화를 나누게 되어 기대됩니다.
저도 마찬가지입니다. 마크, 예전에 제가 마크가 살고 계신 샌디에이고의 퀄컴에서 칩을 설계하던 시절을 떠올려보면, Beowulf 클러스터는 NASA에서 처음 등장한 고성능 컴퓨팅 엔지니어링의 경이로움이었고, 이후 Penguin이 ClusterWareAI를 통해 이를 상용화했죠. 즉, 컴퓨팅 자원을 소프트웨어로 묶어 확장 가능하고 고성능인 시스템처럼 동작하게 만든 것입니다. 그런 역사적 배경을 고려하면, Penguin은 상당히 극적인 변화를 겪어 왔습니다. 이제 회사는 AI 팩토리 플랫폼으로 전환하고 있습니다. Penguin이 현재 단계에 이르기까지 어떤 과정을 거쳐 왔는지, 그 단계들을 설명해 주실 수 있을까요?
네, 좋습니다. 아주 좋은 질문이고, NASA와 이 역사의 출발점을 언급해 주신 것도 흥미롭습니다. Penguin은 실제로 NASA와의 그 작업까지 거슬러 올라가는 공로를 인정받아, 불과 몇 년 전 Space Technology Hall of Fame(우주기술 명예의 전당)에 헌액되기도 했습니다. 이러한 기원의 핵심은 슈퍼컴퓨팅이 발전하던 시기에, 확장 가능한 노드들을 활용해 그 노드들을 조립하여 초고성능 컴퓨팅 클러스터를 만들고, 큰 문제를 더 작은 문제로 쪼갠 뒤 확장 가능한 병렬 방식으로 처리하고, 마지막에 결과를 다시 결합하는 발상이었습니다.
흥미로운 점은 Penguin이 상당히 큰 변화를 거쳐—주로 하드웨어 및 어쩌면 연구 조직 중심의 고성능 컴퓨팅(HPC) 솔루션 제공업체에서—오늘날 우리가 서 있는 지점, 즉 (조금 뒤에 더 말씀드리겠지만) 대용량 메모리 솔루션과 AI 인프라가 만나는 교차점에서 사업을 운영하는 현재의 모습으로 왔다는 것입니다. 오늘날 AI가 폭발적으로 확산되는 가운데 그 기반이 되는 핵심 인프라와 핵심 아키텍처 모델은, 사실 그 초기 모델과 상당히 일관되며 그로부터 진화해 왔습니다. 저희가 여기에 가져오는 것은 25년에 걸친 축적된 역사와 역량이고, 이를 위해 갈고닦아 온 기술 스택입니다. 그리고 지금은 적시에 적소에 있는 상황으로, 20년 넘게 준비해 온 그 역량이 이제 거의 모든 기업이 활용하고자 하는 기술로 발전했습니다.
좋습니다. Penguin을 경쟁사들과 비교해 이해해 보자면, 오픈하고 벤더 중립적인 엔드투엔드 솔루션이 있는 반면, 독점적이고 벤더 락인 형태의 시스템도 있는 것 같습니다. Penguin이 최근 NVIDIA AI 팩토리 파트너가 됐죠. 이게 어떤 방식으로 작동하나요? 그리고 ClusterWareAI와 OriginAI가 AMD 랙도 유사한 기능 수준으로 지원하나요, 아니면 소프트웨어와 툴링에 변경이 필요하나요?
그것도 또 좋은 질문입니다. 철학적으로 말씀드리면, Penguin이 늘 해온 것 중 하나는 고객의 세계에 한 발을 딛고 있는 관점으로 운영하려고 해왔다는 점입니다. 즉, 워크로드를 먼저, 고객을 먼저 생각한 다음, 사용 가능한 기술들의 ‘팔레트’를 살펴보면서 고객의 목표를 위해 시장에 있는 모든 것들 가운데 무엇을 가장 잘 골라 조합해 최적의 솔루션을 구성할지 고민합니다. 누군가 어떤 문제를 들고 오든 동일한 아키텍처와 동일한 솔루션을 그대로 밀어붙이기보다는, 최고의 것들 중 최고의 것들을 결합하는 훨씬 더 신중한 접근을 취한다고 생각하시면 됩니다. 다만, 그럼에도 NVIDIA는 대단한 일을 해왔습니다.
말씀하신 것처럼, 저희는 이미 한동안 DGX-ready 매니지드 서비스 파트너로 활동해 왔는데, 이는 대규모 AI 클러스터를 관리하고 운영 환경에 안착시키는 역량에서 최고 수준의 경험을 입증했다는 의미입니다. NVIDIA가 이런 대규모 AI 팩토리를 구축하는 데 특화된 ‘AI 팩토리 스페셜라이즈드 파트너’라는 새로운 프로그램을 발표했고, 저희는 그 초기 파트너로 선정됐습니다. 저희는 NVIDIA 클러스터에 특화된 매우 깊은 전문성을 보유하고 있습니다. 실제로 저희는 고객과 함께 이를 운영해 왔고, 대규모로 GPU 클러스터를 관리해 온 런타임 경험이 누적 40억 시간 이상입니다. 그렇다고 해서 저희가 닫혀 있는 것은 아닙니다. 저희는 완전히 오픈되어 있습니다. 아시다시피 저희의 전통에서도 Intel 기반 CPU 아키텍처와 AMD 기반 CPU 아키텍처를 모두 제공해 왔습니다.
오늘날 고객이 선택할 수 있는 실리콘 옵션이 폭발적으로 늘어나는 환경에서, 저희는 고객에게 필요하다면 NVIDIA 클러스터든 AMD 클러스터든, 또는 그 밖의 다른 클러스터든 동일하게 기쁘게 제공할 수 있습니다. 최근 저희가 진행한 실적 발표에서도 언급했던 사례 중 하나는 샌디아 국립연구소(Sandia National Laboratories)에 ‘Spectra’라는 시스템, 즉 클러스터를 제공한 것입니다. 이는 Kneron 실리콘 기반의 고급 가속기를 적용한 것으로, 고객이 구동하고자 했던 워크로드에 매우 잘 매핑된 사례였습니다. 이는 NVIDIA나 AMD를 넘어, 다른 실리콘 옵션들도 새롭게 등장하고 있다는 또 다른 예시입니다. ‘불가지론적(agnostic)’이라는 표현은 다소 너무 포괄적인 단어일 수도 있겠습니다. 저희는 여러 측면에서 분명한 견해를 가지고 있지만, 그 견해는 고객을 대변하는 옹호자의 관점에서의 견해라고 생각합니다. 고객이 무엇을 하려는지 살펴보고, 무엇이 가장 잘 작동할지 저희가 판단하는 바를 권고드릴 것입니다.
대규모 클러스터에서 수십억 시간에 달하는 GPU 런타임 경험을 언급하셨습니다. 그 경험이 경쟁사가 쉽게 재현할 수 있는 ClusterWareAI의 가치에 어떤 식으로 반영되나요? 학습 플라이휠(learning flywheel) 같은 것인가요, 아니면 그간 축적해 온 모든 엔지니어링 지식과 모범 사례(best practices)에 기반한 ‘해자(moat)’에 불과한 건가요?
저희도 그 과정은 진행하면서 꽤 흥미로운 여정이었습니다. 2016년, 2017년 무렵부터 이런 대형 GPU 시스템을 본격적으로 구축하기 시작했는데, 당시에는 전 세계를 휩쓴 이른바 AI 열풍이 아직 완전히 구체화되기 전이었습니다. 저희는 HPC 아키텍처를 기반으로 하되 GPU를 통합해 이러한 시스템을 구축해 왔습니다. 그런 규모에서 운영을 시작하면, 시스템이 어떻게 동작하는지만이 아니라 어떻게 고장 나는지도 배우게 됩니다. 이상적으로는, 개별 구성요소가 실제로 고장 나기 전에 잠재적 고장 가능성을 어떤 신호로 보이기 시작하는지도 학습하게 됩니다.
저희가 실제로 해온 일은, 각종 장애가 발생할 때마다 사후에 돌아가서 “로그에서 그 GPU가 고장 날 것이라든지 그 네트워크 어댑터가 고장 날 것이라는 단서를 미리 볼 수 있는 게 있었을까?”라고 점검하고, 그러한 학습을 계속 축적해 온 것입니다. 그리고 이제 이러한 시스템을 배포하고 관리하는 데 사용하는 ‘ClusterWareAI’라는 핵심 소프트웨어 플랫폼에서는, 마치 시스템을 안정적으로 유지하는 데 남다른 감각이 있는 최고의 데이터센터 엔지니어가 있는 것처럼, 그 모든 학습을 정제해 담아냈습니다.
저희는 그 학습을 분석(analytics) 기법을 활용해 소프트웨어 안으로 모두 농축해 담고자 했습니다. 그래서 지금도 저희의 최상급 서비스 엔지니어들이 고객과 함께 데이터센터에서 이런 시스템을 운영·관리하고 있지만, 동시에 ClusterWareAI와 함께 돌아가는 ‘조용한 조력자’가 있어 사람이 할 수 없는 일들을 수행합니다. 클러스터가 동작하는 동안 하루 매 분마다 수백만 개의 데이터 포인트를 관측하면서, “아, 저쪽에 네트워크 문제가 생기겠는데?” 같은 징후를 포착할 수 있는 것이죠. 저쪽에 네트워크 이슈가 발생할 겁니다. 그렇다면 장애가 나서 사용자 작업에 영향을 주고 중단을 유발하기 전에, 해당 노드를 클러스터에서 매끄럽게 분리했다가 기술자가 수리할 수 있도록 옆으로 빼두고, 수리 후 다시 무리 없이 클러스터에 복귀시키는 게 어떻겠습니까.
결국 저희가 여기서 말씀드리는 전체 과정의 결과는, 고객 입장에서 더 높은 운영 처리량(operational throughput), 더 적은 중단, 그리고 이런 초대형 시스템을 운영할 때 더 많은 가동시간(uptime)입니다. 참고로 말씀드리면, 저희는 매일 계속 배우고 있습니다. 저희가 이제 다 끝났다는 뉘앙스로 들리게 하고 싶지는 않습니다. 새로운 GPU가 나오고 새로운 시스템 구성요소가 추가될 때마다, 저희는 그 학습을 계속 축적해서 엔진에 다시 반영하고 있습니다.
전체 스크립트
전체 번역 스크립트는 StockNow에서 확인해보세요.
전체 발언, 영문 원문과 발언자별 기록은 StockNow Pro에서 확인할 수 있습니다.
Pro로 전체 스크립트 보기AI 번역에는 일부 부정확한 표현이 포함될 수 있습니다.
어닝콜 참가자
이 어닝콜에는 2명이 참여했지만, 지금 보이는 건 1명뿐입니다.
참가자 명단
참가자 정보는 StockNow에서 확인하세요.
로그인하면 경영진과 애널리스트의 이름, 역할과 전체 발언 기록을 확인할 수 있습니다.
로그인하고 참가자 전체 보기더 살펴보기
