
현대 기업의 워크로드가 확장됨에 따라 데이터 센터 서버 패브릭을 25G에서 100G로 마이그레이션하는 것은 장기적인 목표에서 시급한 운영 요구 사항으로 바뀌었습니다. 그러나 전체 하드웨어 생태계를 한 번에 교체하는 것은 현실적으로 어렵기 때문에 네트워크 엔지니어는 기존 서버 인프라를 차세대 고속 스위치 패브릭과 원활하게 통합해야 합니다.
스위스 IT 서비스 제공업체인 Axiom Cloud는 이러한 물리적 계층 문제를 해결하기 위해 기존 25G HPE 서버 인터페이스를 새로운 100G 집계 포트에 연결할 때 심각한 대역폭 제한에 직면했습니다. 표준을 준수하는 솔루션을 전략적으로 배포함으로써 이 문제를 해결했습니다. LINK-PP Axiom Cloud는 QSFP28-100G-SR4 광 모듈을 통해 서버 인터페이스 불일치를 해결하고 물리 계층 신호 저하를 제거하며 전면 패널 포트 활용도를 극대화하여 서버 패브릭을 확장 가능하고 처리량이 높은 네트워크 백본으로 원활하게 통합했습니다.
프로젝트 배경 및 고객 인프라 요구 사항
스위스 전역에서 기업 클라우드 마이그레이션이 가속화됨에 따라 지역 서비스 제공업체는 물리적 서버 용량을 고밀도 코어 네트워킹 패브릭에 지속적으로 맞춰야 합니다. 다중 테넌트 호스팅 환경에서 초저지연 및 중단 없는 가동 시간을 유지하려면 민첩하고 확장 가능한 물리적 계층 인프라가 필수적입니다.

Axiom Cloud의 확장되는 엔터프라이즈 관리형 호스팅 서비스
Axiom Cloud는 스위스 전역의 기업 고객에게 미션 크리티컬한 관리형 호스팅, 프라이빗 클라우드 클러스터 및 전용 서버 환경을 제공합니다. 데이터 집약적인 기업 애플리케이션의 빠른 도입으로 인해 호스팅 시설 내 트래픽 밀도와 동시 상호 연결 요청이 급격히 증가했습니다. 이러한 관리형 서비스를 제공하기 위해서는 엄격한 서비스 수준 계약(SLA)을 충족하고 국소적인 처리량 저하를 방지하기 위해 물리적 계층의 안정성이 매우 중요합니다.
성능 저하 없이 지속적인 테넌트 확장을 지원하기 위해 Axiom Cloud는 서버 밀도와 랙 상호 연결 용량을 지속적으로 확장해야 합니다. 고성능 호스팅 환경을 위해서는 I/O 큐잉 병목 현상 없이 갑작스러운 워크로드 급증을 흡수할 수 있는 기본 네트워크 패브릭이 필요합니다. 따라서 엔터프라이즈 포트폴리오 확장을 위해 공급자의 핵심 랙-집계 아키텍처에 대한 맞춤형 업그레이드가 필수적이었습니다.
지역 데이터 센터 전반에 걸쳐 대역폭 요구량이 증가하고 있습니다.
Axiom Cloud의 지역 데이터 센터 간 데이터 이동량이 가상 머신 마이그레이션, 실시간 데이터베이스 복제 및 자동화된 오프사이트 백업 루틴으로 인해 급증했습니다. 기존 분산 계층 업링크는 항상 최대 용량에 근접하여 작동하고 있었으며, 예상치 못한 트래픽 급증에 대비할 여유 공간이 거의 없었습니다. 이러한 지속적인 대역폭 압박은 패킷 지연 시간을 증가시키고 공급자가 새로운 기업 테넌트를 온보딩할 수 있는 역량을 제한할 위험이 있었습니다.
데이터센터 내 동서 트래픽 경로를 업그레이드하는 것은 내부 링크 포화를 해소하고 예측 가능한 네트워크 응답 시간을 유지하는 데 필수적이었습니다. 서버 랙과 집계 스위치를 연결하는 기존 25G 링크는 고밀도 컴퓨팅 클러스터에서 생성되는 동시 데이터 스트림을 더 이상 처리할 수 없었습니다. 이러한 대역폭 제약을 해결하기 위해서는 고밀도 100G 광 백본으로의 체계적인 마이그레이션이 필요했습니다.
100G 인프라 업그레이드를 위한 핵심 목표 정의
이번 인프라 업그레이드의 주요 목표는 기존 HPE 서버 하드웨어 투자를 완벽하게 보호하면서 데이터 센터 상호 연결 패브릭을 100G 회선 속도 처리량으로 전환하는 것이었습니다. Axiom Cloud는 운영 중인 서버 인터페이스 카드를 비용이 많이 들고 서비스 중단을 초래하는 방식으로 교체하지 않고도 집계 병목 현상을 해결할 수 있는 배포 전략이 필요했습니다. 새로운 100G 스위치 포트와 기존 HPE 랙 서버 간의 원활한 멀티벤더 상호 운용성을 보장하는 것이 주요 목표로 설정되었습니다.
또한, 이 프로젝트는 단거리 멀티모드 광섬유 회선 전반에 걸쳐 엄격한 비용 효율성과 광 링크 안정성을 최우선 과제로 삼았습니다. 목표 아키텍처는 유연한 100G-to-4x25G 브레이크아웃 케이블을 활용하여 단일 100G 스위치 인터페이스로 여러 25G 서버 포트를 효율적으로 지원할 수 있어야 했습니다. 이러한 핵심 매개변수를 설정함으로써 Axiom Cloud는 마이그레이션을 통해 즉각적인 처리량 향상을 달성하는 동시에 향후 네트워크 확장을 위한 기반을 마련했습니다.
기존 25G HPE 서버를 100G로 마이그레이션하는 데 있어 병목 현상
새로운 100G 스위치를 추가하면서 Axiom Cloud의 기존 서버 랙에 즉각적인 물리적 문제가 발생했습니다. 엔지니어링 팀은 기존 25G HPE 서버가 새로운 100G 패브릭에서 예상 처리량을 달성하지 못하게 하는 세 가지 주요 물리적 계층 병목 현상을 파악했습니다.

기존 25G 서버 인터페이스의 대역폭 제한
Axiom Cloud의 HPE ProLiant 서버는 일상적인 작업에는 문제없이 작동하는 25G SFP28 네트워크 카드를 사용했습니다. 그러나 테넌트 트래픽이 급증하면 이러한 단일 25G 링크로는 용량이 빠르게 부족해졌습니다.
시스템 테스트 결과 기존 25G 서버 포트가 한계에 도달한 주요 원인은 세 가지로 밝혀졌습니다.
- 포트 포화: 25G 링크는 피크 시간대에 최대 속도로 작동했으며 더 이상 속도를 높일 수 없었습니다.
- 버퍼 오버플로: 네트워크 카드의 작은 메모리가 가득 차서 데이터가 대기 상태에 놓였습니다.
- 트래픽 충돌: 야간 백업과 실시간 트래픽이 동일한 링크를 통해 충돌하여 라이브 서비스에 지연이 발생했습니다.
기존 25G HPE 하드웨어와 새로운 100G 스위치 포트의 연결
새로운 코어 스위치는 대형 100G QSFP28 포트를 사용했지만, HPE 서버에는 더 작은 25G SFP28 포트만 있었습니다. 명확한 브리징 전략 없이는 이 두 가지 서로 다른 하드웨어 유형을 직접 연결하는 것은 물리적으로 불가능했습니다.
모든 서버 네트워크 카드를 교체하는 것은 비용이 너무 많이 들고 기존 고객에게도 큰 불편을 초래했습니다. Axiom Cloud는 서버를 원활하게 연결하기 위해 100G 스위치 포트 하나를 25G 채널 네 개로 분할하는 간단한 방법이 필요했습니다.
집계 계층에서 업링크 혼잡 및 패킷 손실 극복
여러 대의 25G 서버에서 발생하는 트래픽이 사용량이 많은 시간대에 메인 스위치 연결부에 과부하를 일으켰습니다. 기존 네트워크 링크는 데이터를 충분히 빠르게 처리하지 못해 각 랙 상단에서 트래픽 정체가 발생했습니다.
실시간 네트워크 모니터링 결과, 이번 업링크 혼잡으로 인해 발생한 세 가지 주요 문제가 확인되었습니다.
- 패킷 손실: 스위치 버퍼가 과부하되어 트래픽 급증 시 데이터 손실이 발생했습니다.
- 지연 시간 증가: 대기 중인 데이터로 인해 사용자의 애플리케이션 응답 시간이 느려졌습니다.
- 부하 불균형: 일부 네트워크 케이블은 과도한 트래픽을 처리하는 반면, 다른 케이블은 사용량이 적었습니다.
100G 링크 문제를 해결하기 LINK-PP LQ-M85100-SR4C
Axiom Cloud가 선택했습니다. LINK-PP LQ-M85100-SR4C 100G QSFP28 광 트랜시버는 서버 인터페이스 불일치 및 전면 패널 포트 부족 문제를 해결합니다. 이 100GBASE-SR4 트랜시버 솔루션은 스위치 용량 낭비 없이 새로운 고속 스위치와 기존 25G HPE 서버를 연결하는 데 필요한 정확한 브레이크아웃 밀도를 제공합니다.

100GBASE-SR4 표준의 광학 사양
LQ-M85100-SR4C QSFP28 100GBASE-SR4 모듈은 MPO-12 멀티모드 인터페이스를 통해 850nm VCSEL 레이저를 사용하여 4개의 독립적인 25Gbps 광 채널에서 작동합니다. 이러한 병렬 아키텍처를 활용하여 단일 100G QSFP28 스위치 포트는 MPO-4xLC 브레이크아웃 케이블을 통해 4개의 전용 25G 링크로 분할됩니다. 이러한 네이티브 브레이크아웃 설계 덕분에 Axiom Cloud는 4개의 개별 25G HPE 서버를 단일 100G 스위치 포트에 연결하여 스위치 포트 효율을 극대화할 수 있었습니다.
개별 서버는 안정적인 25G 연결을 유지하면서 4개의 서버 링크를 하나의 100G 스위치 포트로 통합함으로써 전체 랙 포트 밀도를 크게 향상시켰습니다. 이러한 밀도 증가는 기존 업스트림 업링크 구성을 변경하지 않고도 향후 랙 확장을 위한 전면 패널 포트 용량을 대폭 확보해 주었습니다.
HPE 랙 서버와의 완벽한 하드웨어 상호 운용성
서버 측에서 포트 인식 오류를 방지하기 위해, LINK-PP HPE ProLiant 서버 및 코어 스위치 시스템과의 완벽한 호환성을 위해 LQ-M85100-SR4C 펌웨어를 구성했습니다. 통합 디지털 진단 모니터링(DDM)을 통해 네트워크 관리 콘솔에서 광 수신/송신 전력, 작동 온도, 레이저 바이어스 전류 및 공급 전압을 실시간으로 추적할 수 있습니다.
이 하드웨어 수준의 통합은 4개의 25G 브레이크아웃 채널 전체에서 안정적인 신호 무결성을 보장합니다. 25G 서버 포트에서 광 불일치 및 비트 오류 급증을 제거함으로써 Axiom Cloud는 링크 수준 비트 오류 재전송(FEC 수정) 횟수를 줄여 불필요한 지연 급증을 최소화하고 지속적인 고처리량 부하 환경에서 클라이언트 애플리케이션의 응답 시간을 안정화했습니다.
멀티모드 광섬유를 통한 비용 효율적인 단거리 연결
데이터센터 내 랙 간 링크를 위해 설계된 100GBASE-SR4 표준은 OM3 멀티모드 광섬유에서 최대 70m, OM4 멀티모드 광섬유에서 최대 100m의 전송 거리를 지원합니다. Axiom Cloud는 서버 랙 내부에 이미 설치된 OM4 케이블을 활용함으로써 물리적 광섬유 케이블을 단일 모드 인프라로 교체하는 데 드는 높은 비용을 절감할 수 있었습니다.
이 단거리 브레이크아웃 방식은 운영 중인 25G HPE 서버를 온라인 상태로 유지하면서 랙 네트워크를 현대화하는 데 비용 효율적인 방법을 제공했습니다. SR4 브레이크아웃 트랜시버는 물리 계층 및 포트 밀도 제약을 해결했을 뿐만 아니라, 이러한 안정적인 물리적 기반을 구축함으로써 네트워크가 상위 계층 버퍼 튜닝을 통해 잔여 마이크로 버스트를 처리할 수 있도록 준비했습니다.
25G에서 100G로의 전환 운영 실행
Axiom Cloud는 통합을 위해 체계적이고 단계적인 배포 계획을 실행했습니다. LINK-PP 활성 호스팅 테넌트에게 예기치 않은 서비스 중단을 발생시키지 않고 100G-SR4 트랜시버를 배포했습니다. 운영 배포는 체계적인 물리적 랙 케이블링, 실시간 광 링크 검증, 그리고 모든 기존 HPE 서버 노드에 걸친 철저한 하드웨어 호환성 감사에 중점을 두었습니다.

단계별 모듈 설치 및 랙 케이블링
운영 위험을 최소화하기 위해 배포 엔지니어는 대상 데이터 센터 행 전체에 걸쳐 비수기 유지 관리 시간대에 하드웨어 설치를 예약했습니다. 팀은 설치를 진행했습니다. LINK-PP LQ-M85100-SR4C 모듈을 고밀도 ToR 스위치에 연결하고 MPO-to-4xLC 브레이크아웃 케이블을 인근 HPE ProLiant 서버의 25G SFP28 포트 4개에 직접 연결했습니다.
적절한 굽힘 반경 제어와 색상으로 구분된 분기선을 사용하여 물리적 광섬유 트렁크를 체계적으로 구성함으로써 고밀도 서버 랙 내부의 케이블 혼란을 방지했습니다. 이러한 체계적인 케이블링 접근 방식은 물리적 채널 매핑을 간소화하여 각 25G 서버 링크가 집계 스위치의 지정된 QSFP28 레인에 정확하게 매핑되도록 했습니다.
신호 품질 검사 및 링크 진단
물리적 설치 후, 엔지니어링 팀은 운영 트래픽에 대한 링크 승인을 전에 광학적 무결성을 검증하기 위해 엄격한 물리 계층 진단을 수행했습니다. 검증 과정에는 장기적인 운영 신뢰성을 보장하기 위해 광 출력 수준, FEC 오류율 및 온도 안정성이 포함되었습니다.
다음 표는 현장 검증 중에 모니터링되는 주요 진단 매개변수와 25G-100G 연결 전환에 대한 운영상의 중요성을 요약한 것입니다.
| 진단 매개변수 |
측정 초점 |
브레이크아웃 링크에 미치는 운영적 영향 |
| 처방 광학 파워 |
25G LC 브레이크아웃 다리에서 받은 광량 |
신호 감쇠를 방지하고 수신기 감도 정렬을 보장합니다. |
| 송신 광 출력 |
850nm VCSEL 어레이에서 전송된 레이저 출력 |
4개의 병렬 25G 채널 전체에서 안정적인 광 출력을 검증합니다. |
| FEC 이전 비트 오류율(BER) |
수정 전 물리 계층 오류 발생 횟수 |
광 링크 품질이 허용 가능한 헤드룸 범위 내에 유지됨을 확인합니다. |
| FEC 이후 BER |
MAC 계층에서 수정되지 않은 잔여 프레임 오류 |
스위치 및 서버 인터페이스에 도달하는 패킷에 손상이 전혀 발생하지 않도록 보장합니다. |
| 모듈 온도 및 전압 |
실시간 열 및 전기 작동 매개변수 |
열 스로틀링을 방지하고 전원 공급 변동으로부터 보호합니다. |
HPE 서버 호환성 및 상호 운용성 감사
최종 실행 단계에서는 하드웨어 호환성에 대한 엄격한 검사가 진행되었습니다. LINK-PP 100G-SR4 광 트랜시버, ToR 스위치 운영 체제 및 HPE ProLiant iLO 관리 소프트웨어. 트랜시버 펌웨어 식별 프로파일을 검증하여 HPE 서버 NIC가 타사 하드웨어 경고 또는 링크 끊김 없이 25G 브레이크아웃 채널을 기본적으로 인식하는지 확인했습니다.
최대 트래픽 부하를 시뮬레이션한 환경에서 지속적인 스트레스 테스트를 수행한 결과, 안정적인 링크 자동 협상과 FEC(순방향 오류 수정) 프레임 손실이 전혀 없음을 확인했습니다. 이러한 호환성 검사를 완료함으로써 Axiom Cloud는 물리 계층 업그레이드를 통해 기존 링크 불안정 문제를 완전히 해결하고 서버 인프라 전반에 걸쳐 운영 가시성을 완벽하게 유지했음을 검증했습니다.
프로젝트 성과 및 네트워크 확장성
배포하여 LINK-PP LQ-M85100-SR4C 100G-SR4 광 트랜시버 모듈을 사용하여 Axiom Cloud는 서버 패브릭을 성공적으로 현대화하고 랙 상호 연결 밀도를 4배로 높이는 동시에 운영 중인 25G HPE 서버 투자를 완벽하게 보호했습니다. 브레이크아웃 아키텍처는 스위치 포트 효율성을 극대화하고 물리 계층 신호 저하를 제거하여 향후 네트워크 확장 및 상위 계층 버퍼 튜닝을 위한 안정적인 기반을 마련했습니다. 이러한 비용 효율적인 전환을 통해 전면 패널 포트 고갈 문제를 해결하고 모든 지역 데이터 센터 랙에서 예측 가능한 처리량을 보장했습니다.
본 프로젝트는 고밀도 표준 준수 광 트랜시버를 통해 값비싼 서버 교체 없이도 세대별 하드웨어 불일치를 해소할 수 있음을 입증합니다. 데이터 센터 마이그레이션을 위한 안정적이고 높은 상호 운용성을 갖춘 광 트랜시버를 알아보려면 다음 웹사이트를 방문하십시오. LINK-PP 공식 스토어.