도전 과제
인공지능 스타트업이 LLM에 기반한 제품을 구축하는 데는 생산 수준의 추론 인프라가 빠르게 필요했습니다. 팀은 긴 GPU 납품 시간, 긴 예산 및 내부 데이터 센터 경험이 없었습니다.그들은 구성 할 수있는 공급자가 필요했습니다, 테스트하고 실행할 준비가 된 클러스터를 배달합니다.
해결책
우리의 엔지니어들과 함께, 고객은 그들의 추론 작업 부하에 맞게 구성된 Dell GPU 서버를 선택했습니다:
- 인텔 Xeon 확장 가능한 프로세서, 고 코어 횟수 옵션
- 각 노드마다 여러 개의 NVIDIA 클래스 GPU, 예산에 맞게 크기가
- 고주파 DDR5 메모리 및 NVMe 저장장치
- 사전 설치된 운영 체제와 검증된 드라이버
모든 노드들이 출하 전에 태워지고 스트레스 테스트를 받았습니다. 그리고 우리는 단계적인 배달 계획을 제공하여 팀이 첫 번째 노드들을 테스트하기 시작할 수 있도록 했습니다. 나머지 노드들이 도착할 때까지 말이죠.
결과
- 클러스터는 7주 내에 배치됩니다. 다른 곳에서는 2개월의 시간이 소요됩니다.
- 이전 단일 GPU 설정에 비해 10% 감소 추론 지연
- 24개월 동안 동일한 클라우드 GPU 인스턴스를 임대하는 것에 비해 10%의 비용 절감
가장 중요 한 교훈
첫 번째 클러스터의 크기가 가장 큰 클러스터를 구매하는 것보다 더 중요합니다.공장 직접 하드웨어와 수요가 증가함에 따라 확장하여 자본을 과잉 투입하지 않고 이 스타트업을 실행하도록.
인공지능 추론이나 훈련 인프라를 계획하기 위해 저희에게 연락하세요.