OpenAI ra mắt GPT-6 Astra, Greg Brockman nói về ‘kỷ nguyên AGI’

OpenAI ra mắt GPT-6 Astra, Greg Brockman nói về ‘kỷ nguyên AGI’

OpenAI công bố GPT-6 Astra, mô hình trí tuệ nhân tạo mới tập trung vào khả năng sử dụng máy tính, lập trình, nghiên cứu và an ninh mạng. Chủ tịch Greg Brockman cho rằng đây có thể là một trong những dấu mốc mở đầu “kỷ nguyên AGI”, dù giới nghiên cứu chưa có tiêu chuẩn thống nhất để xác định trí tuệ nhân tạo tổng quát.

GPT-6 Astra được OpenAI giới thiệu ngày 3/9, hướng đến những nhiệm vụ phức tạp, kéo dài nhiều bước và yêu cầu mô hình trực tiếp thao tác trên máy tính. Thay vì chỉ trả lời câu hỏi, Astra có thể duyệt web, vận hành phần mềm, xử lý tài liệu, nghiên cứu thông tin, viết mã và thực hiện chuỗi công việc theo mục tiêu được giao.

Theo số liệu OpenAI công bố, GPT-6 Astra đạt 72,6% trên OSWorld 2.0 (cao hơn 65,7% của GPT-5.6 Sol) trong khi chỉ mất khoảng 40 phút mỗi nhiệm vụ thay vì 75 phút. Trên Agents’ Last Exam, mô hình đạt 59,3%, vượt cả Claude Opus 5. Đặc biệt, Astra gần như bão hòa một số bài kiểm tra khó nhất hiện nay: 99,9% ARC-AGI-3, 97,6–98% FrontierMath Tier 4 và 100% ExploitBench.

Tại sự kiện công bố, Greg Brockman, Chủ tịch kiêm đồng sáng lập OpenAI, nhận định khi nhìn lại quá trình phát triển trí tuệ nhân tạo tổng quát trong những năm tới, Astra có thể được xem là một cột mốc đáng chú ý. Đây là đánh giá của lãnh đạo OpenAI, không phải kết luận đã được giới khoa học công nhận rộng rãi.

Trí tuệ nhân tạo tổng quát, thường được gọi tắt là AGI, hiện chưa có định nghĩa và thước đo thống nhất. OpenAI từng mô tả AGI là những hệ thống có mức độ tự chủ cao, có khả năng vượt con người trong phần lớn công việc tạo ra giá trị kinh tế. Tuy nhiên, chưa có bài kiểm tra hay tiêu chuẩn quốc tế nào đủ để xác nhận một mô hình đã đạt ngưỡng này.

Điểm đáng chú ý của Astra là khả năng hoạt động như một tác tử AI. Hệ thống có thể tiếp nhận mục tiêu, chia nhỏ công việc, sử dụng công cụ và thực hiện nhiều bước liên tiếp mà không cần người dùng ra lệnh cho từng thao tác. Đây cũng là hướng phát triển được các hãng AI lớn theo đuổi khi chuyển từ chatbot sang các hệ thống có khả năng trực tiếp thực hiện công việc.

Theo OpenAI, Astra đạt kết quả cao trong các bài đánh giá về sử dụng máy tính, kỹ thuật phần mềm, khoa học, an ninh mạng và tự động hóa tác vụ. Công ty cho biết mô hình có thể rút ngắn thời gian xử lý một số quy trình vốn cần nhiều thao tác thủ công. Hiệu quả thực tế vẫn phụ thuộc vào loại nhiệm vụ, dữ liệu, công cụ được cấp và môi trường triển khai.

An ninh mạng là một trong những lĩnh vực trọng tâm được OpenAI đặc biệt nhấn mạnh. Trong Khung Đánh giá Mức độ Sẵn sàng (Preparedness Framework) của hãng, mô hình Astra được xếp ở mức Critical – cấp độ rủi ro cao nhất. Trên bài kiểm tra ExploitBench, Astra đạt điểm số tuyệt đối 100%, vượt trội so với mức 78,5% của GPT-5.6 Sol.

Theo OpenAI, khi được cung cấp đầy đủ công cụ và quyền truy cập, Astra có khả năng hỗ trợ phát hiện lỗ hổng phần mềm, phân tích mã nguồn và thực hiện nhiều nhiệm vụ nghiên cứu bảo mật chuyên sâu. Để hạn chế tối đa nguy cơ bị lạm dụng, công ty cho biết đã triển khai nhiều lớp kiểm soát an toàn, đồng thời chuyển các tác vụ nhạy cảm sang quy trình thẩm định bổ sung.

Sự phát triển của tác tử AI cũng đặt ra bài toán giám sát. Một chatbot chủ yếu tạo câu trả lời, trong khi tác tử có thể thực hiện hàng chục hoặc hàng trăm thao tác liên tiếp trên phần mềm và dữ liệu thực tế. Sai sót vì vậy không chỉ nằm ở nội dung trả lời mà có thể dẫn tới hành động ngoài dự kiến nếu mục tiêu, quyền truy cập hoặc cơ chế kiểm soát được thiết lập không phù hợp.

OpenAI cho biết đang nghiên cứu thêm các biện pháp phát hiện hành vi bất thường và cơ chế dừng hệ thống khi hoạt động vượt khỏi phạm vi cho phép. Jakub Pachocki, nhà khoa học trưởng của OpenAI, cũng cảnh báo việc hiểu đầy đủ năng lực của mô hình ngày càng khó khi hệ thống trở nên mạnh hơn.

Về kỹ thuật, GPT-6 Astra hỗ trợ cửa sổ ngữ cảnh khoảng 1,05 triệu token và tối đa 128.000 token đầu ra. Quy mô này cho phép mô hình xử lý lượng lớn tài liệu và duy trì thông tin trong những phiên làm việc dài. OpenAI công bố giá giao diện lập trình ứng dụng ở mức 10 USD cho một triệu token đầu vào và 50 USD cho một triệu token đầu ra, trước các điều kiện giá riêng đối với ngữ cảnh rất lớn.

Astra cũng được OpenAI định hướng mạnh vào thị trường doanh nghiệp. Không lâu sau khi mô hình được giới thiệu, hãng công bố ChatGPT for Financial Services dành cho ngành tài chính, sử dụng GPT-6 Astra và tích hợp dữ liệu từ các nhà cung cấp như LSEG, PitchBook và Daloopa.

Dù OpenAI đặt Astra trong bối cảnh “kỷ nguyên AGI”, khả năng tự động hóa nhiều công việc chưa đồng nghĩa mô hình đã đạt trí tuệ tổng quát. Điểm rõ ràng hơn là AI đang chuyển từ công cụ tạo nội dung sang hệ thống có thể trực tiếp thực hiện công việc. Khi mức độ tự chủ tăng, yêu cầu về bảo mật, phân quyền và giám sát cũng trở thành vấn đề lớn hơn đối với doanh nghiệp triển khai công nghệ này.

Benchmark chính (số liệu OpenAI công bố)

Lĩnh vực Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1 Claude Opus 5 Ghi chú
Lý luận trừu tượng ARC-AGI-3 99,9% 7,8% 30,2% Gần bão hòa, vượt baseline hiệu quả hành động của con người trên 96% level
Toán học FrontierMath Tier 4 (v2) 97,6–98% 83,0% 87,8% 73,2% Đã giúp giải một số bài toán mở lâu năm
An ninh mạng ExploitBench 100% 78,5% 70% Mức Critical trong Preparedness Framework
Computer Use OSWorld 2.0 72,6% 65,7% 70,2% Thời gian trung bình ~40 phút/task (giảm ~47% so với Sol ~75 phút)
Agent chuyên nghiệp Agents’ Last Exam 59,3% 53,6% 55,5% Tiết kiệm ~65% output tokens so với Opus 5
Khoa học Terminal-Bench Science 0.1 64,6% 22,4% 52,6% 30,0% Chi phí ước tính thấp hơn đối thủ
Lập trình Terminal-Bench 4.0 57,7–57,9% 37,3% 55,8% 52,3%  
  DeepSWE v1.1 74,1% ~72,7% 67,4% 73,7%  
CAD / 3D BenchCAD 95,9% 83,3% 84,3% Geometric-overlap score
Kiến thức chuyên gia GPQA Diamond 96,0% 94,6% 93,7% 93,7%  

Biên tập: Có hỗ trợ  AI

Bài viết liên quan