GPT-6 Astra: “AGI đã đến” hay mới chỉ bắt đầu kỷ nguyên AI tự làm việc?
GPT-6 Astra tạo bước nhảy ở computer use, coding và tự động hóa, nhưng không dẫn đầu mọi benchmark, giá cao hơn và gây tranh luận về AGI, an toàn AI.
Chỉ bốn năm sau khi ChatGPT bùng nổ, cuộc đua AI lại có một cột mốc khiến cả giới công nghệ tranh luận. OpenAI ra mắt GPT-6 Astra ngày 3/9 và gọi đây là mô hình thông minh, “aligned” nhất của hãng. CEO Nvidia Jensen Huang tuyên bố “AGI đã xuất hiện”, trong khi nhiều nhà nghiên cứu cho rằng còn quá sớm để dùng hai chữ AGI.
Nhưng với người dùng và doanh nghiệp, tranh cãi tên gọi có thể che mất thay đổi quan trọng hơn: Astra cho thấy AI đang dịch chuyển rất nhanh từ “trả lời câu hỏi” sang “tự thực hiện một chuỗi công việc trên máy tính”. Và chính khả năng giao việc cho AI — chứ không phải một điểm benchmark đơn lẻ — mới là thứ có thể thay đổi cách chúng ta làm việc.
Điều đáng chú ý nhất ở Astra không phải là nó “thông minh hơn”
Trong thông báo chính thức, OpenAI mô tả Astra có thể điền biểu mẫu, cập nhật hồ sơ khách hàng trong CRM, sắp xếp lịch, nghiên cứu trên web, soạn nội dung trong email hoặc trình soạn thảo, phân tích dữ liệu, dựng website và tự chạy kiểm thử giao diện. Nó cũng có thể cài đặt, thử phần mềm và xử lý sự cố nhìn thấy trên màn hình.
Đó là khác biệt lớn giữa một chatbot và một hệ thống có thể thực thi công việc.
Trên OSWorld 2.0 — benchmark đo khả năng sử dụng máy tính — OpenAI báo cáo Astra đạt 72,6%, so với 65,7% của GPT-5.6 Sol. Trong mô phỏng độ trễ của hãng, Astra hoàn thành tác vụ trong khoảng 40 phút so với khoảng 75 phút của Sol, tức ít thời gian hơn khoảng 47%.
Ở AutomationBench, Astra đạt 41,4%, trong khi Sol đạt 18,1%. Đây không phải bằng chứng rằng AI đã “thay người”, nhưng nó cho thấy biên công việc có thể giao cho AI đang mở rộng rất nhanh: từ tạo một đầu ra đơn lẻ sang xử lý một quy trình nhiều bước.
Đọc thêm: OpenAI: AI Agent tạo 3,1 ngày công cho mỗi ngày công người.
“Mạnh nhất” không có nghĩa là tốt nhất ở mọi việc
Đây là điểm rất dễ bị bỏ qua nếu chỉ đọc tiêu đề ra mắt.
Ngay trong bảng benchmark do OpenAI công bố, Astra không đứng đầu mọi phép đo. Trên Humanity’s Last Exam có sử dụng công cụ, Astra đạt 57,2%, thấp hơn Claude Fable 5.1 ở mức 65%. Ở Artificial Analysis Intelligence Index phiên bản 4.1.1 mà OpenAI dẫn lại, Astra đạt 61,2 điểm, cũng thấp hơn Fable 5.1.
Đánh giá độc lập của Artificial Analysis cho thấy bức tranh tương tự: Astra tiến rõ rệt ở coding agent và một số tác vụ tri thức, nhưng vẫn có các bài đo bị giảm so với thế hệ trước. Nói cách khác, đây là một bước tiến lớn nhưng không phải một đường thẳng đi lên ở tất cả năng lực.
Chi phí cũng là một biến số quan trọng. Giá API chuẩn của Astra là 10 USD cho một triệu token đầu vào và 50 USD cho một triệu token đầu ra. GPT-5.6 Sol tương ứng là 4 USD và 20 USD. Tức đơn giá token của Astra cao gấp 2,5 lần Sol.
Artificial Analysis ghi nhận Astra dùng token hiệu quả hơn ở nhiều bài, nên khoảng cách chi phí thực tế cho một tác vụ có thể nhỏ hơn 2,5 lần. Tuy vậy, ở cấu hình max, họ vẫn đo được chi phí trên tác vụ Intelligence Index của Astra cao hơn Sol khoảng 75%.
Bài học thực tế rất rõ: doanh nghiệp không nên mặc định “model mạnh nhất cho mọi việc”. Model mạnh nhất nên được dùng cho công việc có giá trị cao, nhiều bước, khó kiểm tra hoặc đòi hỏi khả năng dùng công cụ. Những việc lặp lại đơn giản vẫn có thể phù hợp hơn với model rẻ hơn.
Vậy GPT-6 Astra đã là AGI chưa?
Câu trả lời ngắn: chưa có sự đồng thuận.
Jensen Huang viết rằng “AGI đã xuất hiện”. Chủ tịch OpenAI Greg Brockman cũng công khai xem Astra như một cột mốc AGI. Nhưng AGI vốn không có một định nghĩa duy nhất được toàn bộ giới nghiên cứu chấp nhận.
Nhà nghiên cứu Gary Marcus phản bác rằng việc tuyên bố AGI mà không đưa ra một định nghĩa đủ rõ chỉ làm cuộc tranh luận mơ hồ hơn.
Ngay cả thành tích 99,9% trên ARC-AGI-3 cũng không tự động giải quyết tranh luận này. Các bài benchmark đo một tập năng lực trong điều kiện cụ thể; chúng không chứng minh một hệ thống có thể xử lý đáng tin cậy mọi loại nhiệm vụ trí tuệ ngoài đời thật.
Tranh cãi an toàn thực tế hơn nhiều so với tranh cãi tên gọi
Astra là model đầu tiên của OpenAI chạm ngưỡng “Critical” về năng lực an ninh mạng trong Preparedness Framework của hãng. Theo OpenAI, với đúng công cụ và quyền truy cập, model có thể tìm lỗ hổng chưa từng được biết tới và phát triển cách khai thác chúng trên các hệ thống được bảo vệ tốt mà không cần con người hướng dẫn từng bước.
Đáng chú ý hơn, OpenAI cũng thừa nhận phần suy luận bằng chữ của Astra khó giám sát hơn GPT-5.6 Sol trong một số bài kiểm tra. Reuters dẫn lời nhà khoa học trưởng OpenAI Jakub Pachocki rằng khi model mạnh lên, việc hiểu chính xác nó có thể làm gì cũng khó hơn; tiến bộ về trí tuệ không tự động đồng nghĩa với tiến bộ về alignment.
Đọc thêm: GPT-6 Astra chạm ngưỡng cyber “Critical”: doanh nghiệp phải siết quyền AI Agent.
Với doanh nghiệp, thay đổi lớn nhất là “biên giao việc” đang dịch chuyển
Với thế hệ model như Astra, một nhiệm vụ có thể được mô tả ở mức outcome cao hơn: tìm khách hàng tiềm năng và tạo bảng ưu tiên; rà tài liệu và tạo memo; kiểm tra website, sửa code rồi chạy QA; nghiên cứu một chủ đề, tạo bảng tính và cập nhật tài liệu.
Đó là lúc AI bắt đầu giống một “người thực thi công việc” hơn là một ô chat thông minh.
Để giao việc kiểu này an toàn, doanh nghiệp cần bốn thứ: outcome rõ, nguồn chuẩn, giới hạn quyền và tiêu chí nghiệm thu. Model càng mạnh thì năng lực quản lý một nhân sự AI càng quan trọng.
Học AI năm 2026: bớt ám ảnh với “prompt hay”, học cách giao việc thật
Khi model ngày càng hiểu ngữ cảnh tốt hơn, tự biết dùng công cụ và có thể làm một chuỗi việc dài, lợi thế dịch chuyển sang kỹ năng biết giao đúng outcome, cung cấp đúng bối cảnh, thiết kế quy trình, kiểm soát quyền, đặt checkpoint và nghiệm thu đầu ra.
Nói ngắn gọn: model càng mạnh, kỹ năng “ra lệnh cho chatbot” càng ít tạo khác biệt; kỹ năng “quản lý một nhân sự AI” càng quan trọng.
Câu hỏi đáng quan tâm không còn chỉ là: “AI này thông minh đến đâu?” Mà là: “Tôi đã biết giao cho nó công việc gì, với quyền hạn nào, kiểm tra bằng cách nào và đo giá trị ra sao?”
Nếu bạn muốn học AI theo hướng thực chiến — biến những việc đang làm hằng ngày thành quy trình có thể giao cho AI, có nguồn dữ liệu, tiêu chí nghiệm thu và bước kiểm soát rõ ràng — hãy theo dõi các chương trình và tài liệu thực hành mới của Học viện AI.
Nguồn tham khảo
- OpenAI — GPT-6 Astra: A new generation of intelligence
- OpenAI — Safety overview: GPT-6 Astra
- Reuters — OpenAI launches new Astra model amid growing scrutiny over agents’ safety
- Artificial Analysis — Benchmarking GPT-6 Astra
- TechCrunch — OpenAI’s new reasoning technique alarms AI safety experts
- Gary Marcus — phản biện tuyên bố AGI
- VnExpress — AI mạnh nhất của OpenAI gây phản ứng trái chiều
2 công cụ AI miễn phí dành cho bạn
Có thể bạn cần
Tài nguyên & công cụ liên quan từ Học viện AI


