極致速度的代價:一窺 PCIe Gen6 在 AI 浪潮下的進化與技術挑戰
前言(Introduction)
隨著生成式 AI 模型規模激增,系統瓶頸已從算力轉向資料傳輸能力。PCIe 技術扮演 AI 平台的資料動脈,負責串聯核心運算與儲存元件;其世代演進已成為打破通訊瓶頸、提升模型訓練與推論效率的核心驅動力。
隨著 AI 運算對資料吞吐量的極致追求,PCIe Gen6 產業生態已正式進入商用化階段。包含 Astera Labs 在內的指標性IC商,已陸續推出 PCIe 6.0 Retimer 等關鍵組件,將單通道速率推升至 64 GT/s,並透過 PAM4 調變與 FEC 機制確保傳輸可靠性。儘管 Gen6 帶來了更嚴苛的訊號完整性與功耗挑戰,但隨著越來越多支援產品問世,如何加速從 Gen5 轉型至 Gen6 架構,已成為當前 AI 系統維持擴充彈性與效能優勢的戰略重點。
PCIe Gen6 (6.0) 採用PAM4 Encoding(4階脈衝振幅調變)技術
Source:Electronics for Engineers
簡單來說,Gen6 最厲害的地方就在於:它不必強拉奈奎斯特頻率(Nyquist frequency),就能讓傳輸速度直接翻倍到 64GT/s。這是因為它改用了 PAM4,不像傳統 NRZ 一次只能傳 1-bit,PAM4 一個訊號就能帶 2-bit 的資訊,大大減輕了通道損耗的壓力。不過,天底下沒有白吃的午餐,這樣做會讓訊噪比(SNR)變差,所以必須搬出 FEC(前向錯誤修正) 來幫忙抓錯,才能把誤碼率壓下來。
上圖展現NRZ與PAM4的演進:同樣時間內,PAM4靠四種準位直接多傳一倍資料。
上圖則具體表示對應其電壓與編碼。
核心就是:頻率不用拉高,傳輸效率直接翻倍。
PAM4 眼圖測試
眼高(EH)與眼寬(EW)需要針對三個眼圖分別進行量測
- PAM4 的眼高(EH)定義為三個EH量測值中的最小值
- PAM4 的眼寬(EW)定義為三個EW量測值中的最小值
通路合規判定方法是配合選定的傳輸端均衡調節(Tx EQ Preset),來產生符合以下要求的眼高(EH)與眼寬(EW):
- 32.0 GT/s (Gen5):在 10-12 BER,須達到 15 mV 高度與 0.3 UI 寬度。
- 64.0 GT/s (Gen6):在 10-6BER,頂部眼圖須達到 6.0 mV 高度與 0.1 UI 寬度。
上圖呈現了 PCIe Gen6對於訊號品質的最低及格線,重點如下:
- 菱形區域(量測框):這代表了訊號必須張開的「最小空間」。
- Top Eye:因為 PAM4 有三層眼圖,這張圖特別標註了最頂層眼圖的要求。
- 及格數據(Value):
高度 (EH):至少要達到 6 mV。
寬度 (EW):在零交越點(Zero-crossing)至少要有 0.1 UI。
- 量測基準:這些數值都是在誤碼率 10-6 的條件下定義的。
上圖上半部:時域波型(Time Domain Waveform)
Symbols(S0-S3):這是一段連續的電壓變化,可以看到電壓不再只是「高、低」兩階,而是跳躍在四個不同高度。
上圖下半部:眼圖(Eye Diagram)
三層眼孔: 將波型無數次疊加後,形成了三個「眼孔」。
訊號品質指標: 眼孔張得越開(EH/EW越大) ,代表訊號越清晰、誤碼率越低。
Gray Coding: 注意右側的位元排序(00,01,11,10),這是為了相鄰準位出錯時只錯1-bit,降低解碼錯誤的影響。
PCIe Gen6 為什麼 NVDIA B300 / AI Server 一定要上Gen6?
因為AI Server 的頻頸早就不是GPU算力,而是搬運資料的速度。在PCIe Gen5 x16 (63GB/s) 在大型的AI訓練應用中已經不夠用了,GPU等待資料傳輸的時間,甚至比實際運算時間更長。
Generation | Raw Rate | 編碼方式 | x16Lane總頻寬 |
Gen5 | 32GT/s | 128b/130b | 63GB/s |
Gen6 | 64GT/s | PAM4+FLIT | 126GB/s |
Gen6=Gen5 的兩倍速度
「算力」要真的跑得出來,還是得靠次世代互連技術,像 PCIe 6.0 與 CXL,把資料傳輸瓶頸打開。講直接一點,如果資料送不夠快,再高階的 GPU 或 ASIC 也只能卡在那邊等資料,硬體效能根本發揮不出來。這也是為什麼 AI 市場爆發後,業界開始加速導入 PCIe 6.0,甚至提前布局 PCIe 7.0,同時也積極推進 CXL 架構。
換句話說,生成式 AI 帶動的不只是 GPU 與 ASIC 需求成長,它也迫使整個資料中心與伺服器平台全面升級。現在高效能運算晶片進步速度很快,但如果記憶體擴充能力(CXL)與高速傳輸介面(PCIe)跟不上,整體效能一樣會受限。只有算力、記憶體與互連架構三者同步提升,才能真正滿足 AI 時代對效能、延遲與成本效益的要求。
GPU等待資料 VS 運算時間比較
在相同的AI訓練工作量下,PCIe Gen6 可大幅降低GPU等待資料時間,提升整體效率。
就目前PCIe技術發展來看,Astera Labs 已積極推動 PCIe Gen6 生態系發展,特別是在 PCIe Gen6 Retimer 與高速連接解決方案方面,透過與多家產業夥伴合作,加速關鍵元件(如連接器與通道設計)之驗證與整合。
從產業進展來看,Astera Labs 的 PCIe Gen6 Retimer 產品已具備高度成熟度,並正邁向量產階段,顯示 PCIe Gen6 技術已逐步從開發驗證進入實際部署,特別是在 AI Server 與高效能運算(HPC)平台中。
另一方面,市場競爭也同步升溫,主要競爭對手如 Marvell Technology 與 Credo Technology Group 亦積極布局 PCIe Gen6 Retimer 與相關高速互連技術,顯示 PCIe Gen6 已成為下一世代資料中心與AI基礎建設的關鍵戰場,各大廠正加速卡位,爭奪市場主導權。
茂綸是一家專業的電子零件與軟體代理商,為國內外高科技產業提供技術支援和解決方案,致力於協助客戶加速產品開發並提升整體系統效能。其服務範圍涵蓋多元電子應用領域,為工程師與設計團隊提供完整且即時的技術支援。
此外,茂綸亦代理眾多電子零件品牌,致力於在台灣市場推廣包括 PMIC、Analog IC、FPGA、MCU 等各類電子元件。近年來積極布局高速傳輸與資料中心相關應用,Astera Labs 之 PCIe Retimer 產品,支援新一代 PCIe Gen6 高速介面應用,目前已有客戶完成 PCIe Gen6 Retimer 系統設計並進入測試驗證階段。
同時,Microchip Technology 亦積極投入 PCIe Gen6 Switch 與 Retimer 技術發展,顯示高速互連市場已逐步邁入新世代競爭。茂綸透過完整的產品布局與專業技術服務,持續強化其在高效能運算與高速介面領域之市場競爭力,並在電子產業中占有一席之地。
參考文獻與資料來源
- Microchip
- Astera Labs
- Synopsys
- Intel
- Tektronix
- 百佳泰
- 6.4-1.0-PUB — PCI Express® Base Specification Revision 6.4
- 探索PCIe 6.0與CXL技術研討會-翔宇科技
- Yahoo財經
- Electronics for Engineers