AMD đi trước mục tiêu về hiệu quả năng lượng AI ở quy mô rack
Có gì mới? Tính đến giữa năm 2026, AMD đã đạt mức tăng ước tính 4x về hiệu quả năng lượng AI, cao hơn mục tiêu dự kiến 3x ở giai đoạn này và hơn gấp đôi xu hướng lịch sử tại cùng thời điểm. Tiến độ này cho thấy AMD đang tạo đà hướng tới mục tiêu năm 2030 là tăng 20x hiệu quả năng lượng ở quy mô rack cho hoạt động huấn luyện và suy luận AI.¹ ² Điều này cũng phản ánh những nỗ lực của AMD trên toàn bộ silicon, hệ thống và phần mềm nhằm giúp khách hàng mở rộng quy mô khối lượng công việc AI hiệu quả hơn.
Tại sao điều này quan trọng? Nhu cầu điện toán AI đang tăng tốc nhanh chóng, đặt ra yêu cầu cao hơn đối với cơ sở hạ tầng trung tâm dữ liệu. Để đáp ứng nhu cầu đó, cần có đổi mới trên toàn bộ stack: CPU, GPU, mạng, phần mềm, nguồn điện và hệ thống làm mát đều phải phối hợp hiệu quả ở cấp rack và trung tâm dữ liệu. Cải thiện hiệu quả năng lượng có thể giúp mang lại hiệu năng AI cao hơn mà không làm tăng công suất điện, cải thiện tổng chi phí sở hữu và giúp khách hàng mở rộng quy mô nhanh hơn.

AMD đóng vai trò gì?
“Làn sóng hiệu quả AI tiếp theo sẽ phụ thuộc vào việc đồng tối ưu hóa chặt chẽ hơn giữa silicon điện toán, bộ nhớ, các kết nối liên thông, phần mềm và thiết kế hệ thống ở quy mô rack. Mức cải thiện ước tính 4x của chúng tôi đến năm 2026 phản ánh sức mạnh trong cách tiếp cận và tiến độ AMD đang đạt được trên toàn hệ thống, đưa chúng tôi đi trước nhịp độ dự kiến hướng tới mục tiêu năm 2030.”
— Sam Naffziger, senior vice president and Corporate Fellow, AMD
Dự kiến đạt được những cải thiện hiệu quả nào? Dựa trên một khối lượng công việc huấn luyện AI đại diện, các mức cải thiện hiệu quả năng lượng ở quy mô rack theo dự báo của AMD được kỳ vọng sẽ mang lại một trong hai lợi ích liên quan vào năm 2030.
- Cùng mức điện toán, ít tài nguyên hơn: Khoảng hai rack AMD vào năm 2030 được kỳ vọng sẽ cung cấp cùng mức điện toán như 570 rack vào năm 2024, qua đó cho phép giảm 20x lượng điện sử dụng trong giai đoạn vận hành và giảm 28x cường độ carbon.
- Nhiều điện toán hơn, cùng mức năng lượng: Một phương án khác là các cải thiện hiệu quả được kỳ vọng sẽ cho phép lượng điện toán cao hơn 20x, được đo bằng số phép toán dấu chấm động mỗi giây (FLOPs) trên mỗi watt, trong khi sử dụng cùng một lượng năng lượng.
AMD đang tăng hiệu quả như thế nào? AMD đang nỗ lực tăng hiệu quả trên toàn bộ AI stack thông qua những tiến bộ về kiến trúc điện toán, công nghệ quy trình, băng thông bộ nhớ, di chuyển dữ liệu, các kết nối liên thông, phần mềm và đồng thiết kế ở cấp hệ thống. Mục tiêu là cung cấp hiệu năng điện toán cao hơn đáng kể mà không đòi hỏi mức tiêu thụ năng lượng phải tăng với cùng tốc độ.
Khi cơ sở hạ tầng AI mở rộng từ từng node riêng lẻ lên toàn bộ rack, hiệu quả ngày càng phụ thuộc vào mức độ phối hợp giữa CPU, GPU, bộ nhớ, mạng, lưu trữ và phần mềm. AMD áp dụng phương pháp đồng thiết kế ở cấp hệ thống, với các đội ngũ làm việc xuyên suốt các danh mục sản phẩm, nhằm giúp giảm điểm nghẽn, di chuyển dữ liệu hiệu quả hơn và cải thiện hiệu năng trên mỗi watt trên toàn nền tảng.
Nền tảng của các cải thiện hiệu quả là gì? Bên cạnh tối ưu hóa phần mềm, ba yếu tố chính thúc đẩy hiệu năng hệ thống AI gồm năng lực điện toán, băng thông bộ nhớ và băng thông kết nối liên thông. Công nghệ quy trình tiên tiến và các cải tiến kiến trúc giúp tăng hiệu năng điện toán dấu chấm động trên mỗi watt. Kiến trúc tiên tiến và tích hợp bộ nhớ giúp cải thiện băng thông, trong khi các kết nối tốc độ cao và mức độ tích hợp chặt chẽ hơn giúp tăng băng thông mạng. Kết hợp các yếu tố này, AMD kỳ vọng những đổi mới trên sẽ mang lại hiệu năng AI trên mỗi watt cao hơn 20x vào năm 2030 so với năm 2024.
Tại sao bộ nhớ và kết nối liên thông lại quan trọng? Các khối lượng công việc AI hiện đại phụ thuộc vào việc di chuyển lượng dữ liệu lớn một cách hiệu quả. Cải thiện băng thông bộ nhớ, mật độ băng thông và băng thông trên mỗi watt giúp duy trì nguồn dữ liệu cho các bộ máy điện toán đồng thời giảm lãng phí điện năng. Bộ nhớ băng thông cao, bộ nhớ đệm lớn hơn và tích hợp chặt chẽ hơn giữa bộ nhớ và điện toán có thể giảm việc di chuyển dữ liệu không cần thiết, vốn tiêu tốn năng lượng.
Công nghệ kết nối liên thông cũng đã trở thành một phần quan trọng của cơ sở hạ tầng AI hiệu quả khi các mô hình và khối lượng công việc lớn hơn ngày càng phụ thuộc vào khả năng phối hợp hiệu quả giữa GPU, CPU và các thành phần hệ thống khác. Các kết nối scale-up tốc độ cao giúp các hệ thống lớn hơn giảm điểm nghẽn và chia sẻ dữ liệu hiệu quả hơn.
Phần mềm hỗ trợ như thế nào? Phần cứng cung cấp nền tảng, còn phần mềm giúp mở khóa các cải thiện hiệu quả liên tục. Stack phần mềm AMD ROCm™, các tiêu chuẩn mở và sự hợp tác chặt chẽ với khách hàng giúp nhà phát triển và tổ chức triển khai khối lượng công việc AI hiệu quả hơn trên các nền tảng AMD. Các hệ sinh thái mở cũng hỗ trợ tối ưu hóa rộng hơn trên các hoạt động triển khai AI và điện toán hiệu năng cao (HPC).
Những tối ưu hóa này có thể giúp cải thiện cả khối lượng công việc huấn luyện và suy luận AI quy mô lớn, trong đó việc tăng throughput và giảm năng lượng tiêu thụ cho mỗi token được tạo ra ngày càng quan trọng khi các ứng dụng AI mở rộng quy mô.
Khách hàng được hưởng lợi gì? Khách hàng cần nhiều năng lực điện toán hữu ích hơn từ lượng năng lượng sẵn có. Các mức cải thiện hiệu quả ở quy mô rack mà AMD đã đề ra có thể giúp khách hàng AI và HPC đạt được lợi ích ở cấp trung tâm dữ liệu về cơ sở hạ tầng nguồn điện và làm mát, vốn có thể là những yếu tố giới hạn khả năng tăng hiệu năng điện toán. Hiệu quả năng lượng tốt hơn có thể giúp giảm lượng điện sử dụng trong vận hành, cải thiện tổng chi phí sở hữu và hỗ trợ tăng trưởng AI và HPC bền vững hơn.
Nguồn: AMD.com