Bỏ qua tới nội dung
ChatGPT tăng 0,86 điểm trên thang 5, nhưng tư duy nhân quả mới làm ý tưởng đa dạng hơn
tin-tuc

ChatGPT tăng 0,86 điểm trên thang 5, nhưng tư duy nhân quả mới làm ý tưởng đa dạng hơn

Dũng / Học viện AI28 tháng 8, 20267 phút đọc
Tin tức

RCT với 1.053 sinh viên: ChatGPT nâng điểm rubric, còn tư duy nhân quả tăng độ đa dạng ý tưởng. Bài học để thiết kế đào tạo AI doanh nghiệp.

ChatGPT và tư duy phản biện trong đào tạo

Một thử nghiệm ngẫu nhiên với 1.053 sinh viên năm nhất cho thấy hai năng lực thường bị đặt đối lập thực ra tạo ra hai loại giá trị khác nhau. Tiếp cận ChatGPT giúp bài làm tăng 0,86 điểm trên thang 5 so với nhóm đối chứng. Đào tạo tư duy nhân quả không làm điểm rubric tăng, nhưng giúp người học tạo ra ý tưởng đa dạng hơn, giải thích cơ chế rõ hơn và đặt câu hỏi về điều kiện một giải pháp có thể thất bại.

Với trường học và doanh nghiệp, kết luận không phải “AI thắng tư duy” hay “tư duy thắng AI”. Kết luận quan trọng hơn là: nếu chỉ dùng một rubric truyền thống, chúng ta có thể đo được độ trau chuốt nhưng bỏ sót độ độc đáo.

Thử nghiệm được thiết kế thế nào?

Nghiên cứu do các tác giả từ OpenAI, Bocconi University và các tổ chức liên quan thực hiện trong tháng 8/2026. Đây là thử nghiệm đối chứng ngẫu nhiên 2×2 đã đăng ký trước, gồm 1.053 sinh viên năm nhất thuộc 13 lớp của một môn quản trị cơ bản.

Các lớp được phân vào bốn điều kiện:

  • nhóm đối chứng;
  • được đào tạo tư duy nhân quả;
  • được dùng ChatGPT Edu với GPT-4o;
  • vừa được đào tạo tư duy nhân quả vừa được dùng ChatGPT.

Sinh viên có 45 phút để viết tối đa 180 từ tư vấn cách tăng nhận biết và sử dụng cửa hàng merchandise của trường. Hai mươi học viên cao học chấm bài; mỗi bài có ba người chấm theo tiêu chí marketing chuẩn. Nghiên cứu cũng so sánh bài làm với đề xuất của ba chuyên gia và dùng phân tích văn bản để đo số lượng, độ đa dạng của ý tưởng, logic nhân quả và mức tương đồng.

ChatGPT giúp người mới đạt chuẩn tốt hơn

Nhóm có ChatGPT tăng 0,86 điểm so với mức 2,09 của nhóm đối chứng trên thang 1–5. Bài của họ có logic mạch lạc hơn, nhiều ý tưởng hơn và gần với khuyến nghị của chuyên gia hơn. Các tác giả ước tính số lượng ý tưởng và độ mạch lạc giải thích khoảng một nửa hiệu ứng; phần còn lại cho thấy ChatGPT không chỉ “làm văn hay hơn” mà còn cải thiện nội dung trong phạm vi nhiệm vụ chuẩn hóa này.

Điểm này quan trọng với đào tạo nhân sự mới. Khi nhiệm vụ có đề bài rõ, tiêu chí chấm chi tiết và mô hình đã học nhiều ví dụ tương tự, AI có thể giúp người ít kinh nghiệm nhanh chóng tạo đầu ra trông giống một chuyên gia hơn.

Nhưng “giống chuyên gia trên một bài chuẩn” không đồng nghĩa đã hình thành chuyên môn. Người học vẫn phải biết đặt yêu cầu, đánh giá phản hồi và quyết định nội dung cuối. Nghiên cứu cũng không đo khả năng làm việc dài hạn, xử lý dữ liệu nội bộ hay chịu trách nhiệm cho quyết định thực tế.

Tư duy nhân quả tạo giá trị mà rubric không thưởng

Đào tạo tư duy nhân quả làm tăng khoảng 0,5 độ lệch chuẩn về khả năng nhận diện cơ chế và khoảng 0,8 độ lệch chuẩn về logic phản chứng. Người học đưa ra ý tưởng đa dạng hơn và xa hơn so với giải pháp của các bạn cùng lớp.

Tuy vậy, nhóm này không được điểm rubric cao hơn. Một lý do được nghiên cứu nêu ra là tiêu chí chấm thưởng các đáp án quen thuộc và thậm chí phạt những giải pháp đi xa không gian đáp án thông thường. Nói cách khác, người học có thể nghĩ khác tốt hơn nhưng hệ thống đánh giá lại không yêu cầu hoặc không ghi nhận điều đó.

Đây là cảnh báo trực tiếp cho đào tạo AI: nếu bài tập chỉ chấm sự rõ ràng, đầy đủ và đúng mẫu, AI sẽ ngày càng giúp người học tối ưu chính các tiêu chí đó. Khi ấy, điểm số cuối cùng nói ít hơn về khả năng tự lập luận.

Thiết kế đánh giá tách độ trau chuốt và độ độc đáo

Đừng dùng một rubric để đo hai loại năng lực

Học viện AI đề xuất tách đánh giá thành hai trục. Đây là diễn giải biên tập từ kết quả nghiên cứu, không phải tên khung do nhóm tác giả công bố.

Trục 1: Chất lượng đầu ra có AI hỗ trợ

  • Đầu ra có đúng mục tiêu và dữ kiện không?
  • Lập luận có mạch lạc, dễ dùng và phù hợp ngữ cảnh không?
  • Người học có biết kiểm tra, sửa và chịu trách nhiệm cho bản cuối không?

Trục 2: Năng lực tư duy của người học

  • Có chỉ ra cơ chế vì sao giải pháp có thể hiệu quả không?
  • Có nêu giả định, bằng chứng cần kiểm tra và điều kiện thất bại không?
  • Có tạo ra phương án khác biệt thay vì chỉ lặp lại đáp án phổ biến không?

Một bài có thể đạt điểm cao ở trục đầu nhưng thấp ở trục sau. Nếu mục tiêu là tuyển người làm theo quy trình chuẩn, trục đầu có thể quan trọng hơn. Nếu mục tiêu là đào tạo lãnh đạo, chiến lược, sáng tạo hoặc giải quyết vấn đề mới, trục sau không thể bị bỏ qua.

Bốn thay đổi cho chương trình đào tạo AI doanh nghiệp

1. Cho dùng AI, nhưng bắt buộc ghi lại quyết định

Không nên đánh giá người học chỉ bằng prompt hay bản nháp. Hãy yêu cầu họ ghi: AI đề xuất gì, phần nào được giữ, phần nào bị loại, vì sao, và bằng chứng nào đã được kiểm tra.

2. Dạy tư duy nhân quả như một skill độc lập

Prompt tốt không thay thế câu hỏi “vì sao”. Với mỗi đề xuất, người học cần nối hành động với kết quả qua một cơ chế, rồi nêu cách kiểm chứng. Điều này đặc biệt quan trọng trong marketing, sales, vận hành và HR — nơi tương quan dễ bị trình bày thành quan hệ nhân quả.

3. Thiết kế bài tập có nhiều đáp án hợp lý

Nếu đề bài và rubric chỉ dẫn tới một mẫu đáp án, AI sẽ tối ưu rất nhanh. Nên dùng case có dữ liệu thiếu, mục tiêu xung đột hoặc ràng buộc thực tế để người học phải ưu tiên và giải thích trade-off.

4. Chấm cả outcome lẫn reasoning trace

Trong công việc thật, doanh nghiệp cần đầu ra dùng được. Nhưng để phát triển năng lực, cần xem người học có nhận diện giả định, giới hạn và dấu hiệu sai hay không. Cách tiếp cận này phù hợp với nhận định rằng biết nghiệp vụ quan trọng hơn chỉ biết code khi làm việc với AI Agent.

Ví dụ: đổi bài tập marketing trong 30 phút

Thay vì yêu cầu “dùng ChatGPT viết kế hoạch tăng lead”, hãy giao một case có baseline, ngân sách và giới hạn dữ liệu. Yêu cầu học viên:

  1. đề xuất ba phương án;
  2. vẽ cơ chế từ hành động tới lead đủ chuẩn;
  3. nêu hai giả định có thể sai;
  4. chọn chỉ số kiểm chứng sớm;
  5. dùng AI để phản biện phương án;
  6. viết quyết định cuối cùng bằng lời của mình.

Rubric nên tách tối thiểu: chất lượng đầu ra; độ đúng dữ kiện; logic nhân quả; độ đa dạng phương án; khả năng tự kiểm tra. Một bài đẹp nhưng không thể giải thích vì sao sẽ không đạt điểm cao toàn diện.

Giới hạn: chưa thể biến 0,86 điểm thành ROI đào tạo

Đây là nghiên cứu mạnh hơn nhiều khảo sát tự báo cáo vì có thiết kế ngẫu nhiên. Dù vậy, cần giữ đúng phạm vi:

  • mẫu là sinh viên năm nhất tại một trường đại học châu Âu, không phải nhân sự nhiều kinh nghiệm;
  • nhiệm vụ marketing kéo dài 45 phút, tối đa 180 từ;
  • randomization ở cấp lớp, không phải từng cá nhân;
  • điểm số dựa trên rubric cụ thể của case;
  • không đo khả năng duy trì kỹ năng, hiệu suất dài hạn hay kết quả kinh doanh.

Vì vậy, không nên diễn giải thành “ChatGPT giúp mọi người tăng 41% năng suất” hoặc “tư duy phản biện không có giá trị”. Kết quả cho thấy hai can thiệp tác động lên hai loại đầu ra khác nhau.

Nhận định của Học viện AI

Đào tạo AI tốt không bắt người học chọn giữa công cụ và tư duy. Nó giúp họ dùng AI để nâng chất lượng đầu ra, đồng thời xây khả năng chất vấn, giải thích và tạo phương án mới.

Khi AI làm cho câu trả lời chuyên nghiệp trở nên rẻ hơn, giá trị đào tạo dịch chuyển sang ba năng lực: đặt đúng bài toán, kiểm tra đúng bằng chứng và bảo vệ một quyết định có lý do. Đây cũng là lý do chương trình đào tạo AI cho doanh nghiệp cần gắn bài tập với việc thật, baseline, workflow và cách nghiệm thu — không chỉ dạy một danh sách prompt.

Nguồn và phương pháp

Minh bạch lợi ích: một số tác giả thuộc OpenAI hoặc từng làm việc/nhận thù lao từ OpenAI. Nghiên cứu công bố thiết kế thử nghiệm, kích thước mẫu, các nhóm và giới hạn phương pháp; độc giả nên đọc paper gốc trước khi áp dụng vào bối cảnh khác.

#ChatGPT
#Tư duy phản biện
#Đào tạo AI
#Giáo dục AI
#Nghiên cứu AI

Đặt lịch tư vấn 1-1 với chuyên gia

Phân tích nhu cầu AI cho doanh nghiệp bạn trong 30 phút — miễn phí.

ZChat ZaloMessenger0966.399.303