
Huawei muốn nối tới 1 triệu chip AI: Cuộc đua chuyển từ chip đơn sang hệ thống
Huawei đẩy sớm Ascend 960 và thiết kế Peerium hướng tới một triệu bộ xử lý, nhưng lợi thế phần mềm CUDA của Nvidia vẫn là rào cản lớn.
Huawei đang đổi cách cạnh tranh trong hạ tầng AI: thay vì chỉ so hiệu năng từng chip với Nvidia, hãng muốn nối hàng nghìn đến một triệu bộ xử lý thành một hệ thống. Tại Huawei Connect ở Thượng Hải ngày 17/9/2026, công ty công bố lộ trình Ascend mới, kiến trúc Peerium và kế hoạch đẩy sớm hai chip AI năm 2027.
Thông tin đáng chú ý nhất là kiến trúc Peerium được thiết kế để một ngày có thể vận hành tới một triệu bộ xử lý như một hệ thống thống nhất. Nhưng đây là mục tiêu kiến trúc, không phải một cụm một triệu chip đang hoạt động. Chính sự khác biệt đó quyết định cách đọc đúng câu chuyện.

Ascend 960 được đẩy lịch sớm
Theo Reuters, Huawei dự kiến hoàn tất Ascend 960DT trong quý I/2027, sớm hơn ba quý so với kế hoạch cũ. Phiên bản 960PR được nhắm tới quý III/2027, sớm hơn một quý. Công ty cũng dự định phát hành một thế hệ Ascend mới mỗi năm, với dòng 970 vào năm 2028 và 980 vào năm 2029.
Huawei nói thử nghiệm Ascend 950DT đã cho kết quả tốt và hãng đang trao đổi với nhiều nhà phát triển mô hình tại Trung Quốc. Eric Xu, chủ tịch luân phiên của Huawei, kỳ vọng các hệ thống dùng chip này sẽ được áp dụng rộng hơn cho huấn luyện mô hình trong năm tới.
Nhu cầu hiện cao tới mức Huawei cho biết năng lực sản xuất chưa đủ đáp ứng thị trường trong nước, nên chưa có kế hoạch mở rộng bán quốc tế trên quy mô lớn. Đây là tuyên bố của doanh nghiệp tại sự kiện; số liệu công suất cụ thể không được công bố.
Vì sao 4.096 và một triệu bộ xử lý quan trọng?
Một chip riêng lẻ không quyết định toàn bộ hiệu quả huấn luyện. Khi hàng chục nghìn chip cùng làm việc, tốc độ truyền dữ liệu giữa máy, bộ nhớ, lưu trữ và mạng có thể trở thành nút thắt. Huawei nói các cụm khoảng 100.000 chip đã trở nên phổ biến trong một số mô hình lớn nhất, còn giao tiếp giữa máy có thể chiếm hơn 40% thời gian huấn luyện ở hệ thống máy chủ truyền thống.
Để xử lý điểm nghẽn đó, Huawei dùng UnifiedBus nhằm kết nối bộ xử lý, bộ nhớ, lưu trữ và thiết bị mạng. Một supernode Ascend 960 được thiết kế để nối tối đa 4.096 bộ xử lý AI. Nhiều supernode sau đó có thể ghép thành cụm hàng trăm nghìn bộ xử lý; Peerium là lớp kiến trúc được định hướng tới quy mô một triệu.
AP cũng xác nhận Huawei giới thiệu Atlas 960 SuperPoD tại sự kiện, tiếp tục chiến lược dùng quy mô hệ thống để bù giới hạn của từng chip. Đây là cách tiếp cận thực dụng trong bối cảnh doanh nghiệp Trung Quốc không thể tiếp cận đầy đủ chip và thiết bị sản xuất tiên tiến của Mỹ.
Những con số nào đã có, con số nào mới là tuyên bố?
Huawei cho biết đã triển khai hơn 1.000 hệ thống dùng Ascend 910C; dòng Ascend 950 đã bước vào sử dụng thương mại. Hãng cũng công bố hơn 5.200 nhà phát triển hoạt động hằng tháng trên phần mềm Ascend và hơn 40 mô hình AI đã được huấn luyện trực tiếp trên nền tảng này.
Ở chiều ngược lại, nhận định của Eric Xu rằng thị phần Ascend tại Trung Quốc có thể lớn hơn Nvidia không đi kèm dữ liệu chứng minh. Vì vậy, đây nên được xem là đánh giá của lãnh đạo Huawei, không phải số liệu thị phần đã được xác minh độc lập.
Rào cản CUDA vẫn còn nguyên
Quy mô phần cứng chỉ là một nửa cuộc chơi. Nvidia giữ lợi thế lớn nhờ CUDA — hệ sinh thái phần mềm, thư viện và công cụ đã ăn sâu vào quy trình của nhà phát triển. Một cụm mạnh nhưng thiếu công cụ tối ưu, tài liệu, framework tương thích và đội ngũ vận hành vẫn có thể có tổng chi phí chuyển đổi cao.
Đây cũng là lý do các nút thắt AI ngày càng trải dài từ máy quang khắc như ASML High NA EUV, chip, kết nối mạng cho tới phần mềm. Cuộc đua không còn là một linh kiện duy nhất.
Nhận định của Học viện AI
Điểm đáng chú ý nhất không phải con số một triệu, mà là sự dịch chuyển từ “chip mạnh nhất” sang “hệ thống tận dụng chip hiệu quả nhất”. Khi quy mô huấn luyện tăng, năng lực kết nối, lập lịch tác vụ, chia sẻ bộ nhớ và phát hiện lỗi có thể quan trọng ngang với thông số chip.
Với doanh nghiệp mua hạ tầng AI, bài học là không so sánh nhà cung cấp chỉ bằng FLOPS hay giá chip. Cần đánh giá ít nhất bốn lớp: khả năng mở rộng thực tế, hiệu suất liên kết, độ trưởng thành của phần mềm và mức độ khóa chặt vào hệ sinh thái. Những dự án như khuôn viên dữ liệu 2,16 GW của Anthropic hay năng lực tính toán 900 MW của OpenAI tại Malaysia cũng cho thấy AI đang trở thành bài toán quy hoạch hệ thống, không còn là mua vài máy chủ.
Trong ngắn hạn, Peerium chưa chứng minh Huawei đã ngang Nvidia. Nhưng lộ trình này cho thấy một đối thủ có thể rút ngắn khoảng cách bằng kiến trúc hệ thống và hệ sinh thái nội địa, ngay cả khi chip đơn chưa dẫn đầu.
Doanh nghiệp nên theo dõi ba chỉ số
- Hiệu suất sử dụng toàn cụm khi số bộ xử lý tăng, thay vì thông số chip đơn.
- Số mô hình và framework chạy ổn định mà không cần viết lại quá nhiều.
- Tổng chi phí chuyển đổi gồm phần mềm, nhân lực, điện, làm mát và độ tin cậy.
Nếu cần xây lộ trình AI phù hợp quy mô và ngân sách doanh nghiệp, nhận proposal triển khai AI từ Học viện AI.
Nguồn tham khảo
2 công cụ AI miễn phí dành cho bạn
Có thể bạn cần
Tài nguyên & công cụ liên quan từ Học viện AI


