We use cookies

Our website uses essential cookies and, with your consent, additional cookies to measure performance and improve our services. Cookie Policy.

You can change your choice at any time.

MMedXYNews
Trang chủVideo
MedXY AI/Tin tức MedXY/Chuyên mục: Critical Care/Chăm sóc đặc biệt

ChatGPT-4o trong các câu hỏi ôn tập chuyên ngành Y học Hồi sức tích cực: Độ chính xác cao nhưng tiềm ẩn rủi ro trong việc diễn giải đa phương thức

MedXY Editorial Team•28 thg 9, 2026•Critical Care/Chăm sóc đặc biệt
Giáo dục Y khoaHọc đa phương thứchồi sức cấp cứuTrí tuệ nhân tạo

Điểm nổi bật

ChatGPT-4o cho thấy độ chính xác nhỉnh hơn một chút so với kết quả trả lời gộp từ các bác sĩ lâm sàng trên các câu hỏi kiểu ôn thi hội đồng về hồi sức cấp cứu; tuy nhiên, năng lực diễn giải hình ảnh và lập luận lâm sàng còn hạn chế đáng kể, làm dấy lên lo ngại về tính an toàn và độ tin cậy trong các bối cảnh có rủi ro cao. Mô hình thể hiện hiệu quả tốt trong các lĩnh vực hô hấp và ngoại khoa, nhưng kết quả lại kém trong diễn giải siêu âm hồi sức cấp cứu. Khoảng một phần ba câu trả lời của AI tiềm ẩn nguy cơ gây hại lâm sàng do sai sót.

Bối cảnh nghiên cứu

Y học hồi sức cấp cứu đòi hỏi đưa ra quyết định nhanh chóng, dựa trên bằng chứng và tích hợp nhiều loại dữ liệu, bao gồm phát hiện lâm sàng, giá trị xét nghiệm và các thăm dò hình ảnh khác nhau. Kỳ thi chứng nhận chuyên khoa hồi sức cấp cứu yêu cầu năng lực diễn giải thông tin đa phương thức phức tạp. Các mô hình ngôn ngữ lớn (LLM, Large Language Models) như ChatGPT-4o đã cho thấy tiềm năng trong đánh giá kiến thức y khoa, nhưng ít được đánh giá hơn về khả năng diễn giải các câu hỏi đa phương thức có kèm hình ảnh lâm sàng—một kỹ năng thiết yếu trong chẩn đoán và xử trí hồi sức cấp cứu.

Trong bối cảnh ngày càng quan tâm đến việc tận dụng AI cho giáo dục lâm sàng và hỗ trợ quyết định, việc đánh giá nghiêm ngặt độ chính xác, khả năng lập luận và tính an toàn của LLM trong các tình huống lâm sàng liên quan đến hồi sức cấp cứu là rất cần thiết. Việc diễn giải sai hoặc đưa ra khuyến nghị không phù hợp từ các công cụ AI trong bối cảnh này có thể gây hại nếu được đưa vào quá trình ra quyết định hoặc giáo dục mà không có giám sát chặt chẽ của con người.

Thiết kế nghiên cứu

Nghiên cứu quan sát này đánh giá hiệu năng của ChatGPT-4o bằng 183 câu hỏi trắc nghiệm từ ngân hàng câu hỏi của Society of Critical Care Medicine. Các câu hỏi bao quát nhiều lĩnh vực hồi sức cấp cứu khác nhau và có nội dung đa phương thức—kết hợp văn bản với các hình ảnh lâm sàng liên quan như phim X-quang và siêu âm.

Một cấu hình ChatGPT-4o tùy chỉnh đã được phát triển dựa trên một khung đã được thẩm định, được thiết kế để mô phỏng điều kiện của kỳ thi hội đồng chuyên khoa hồi sức cấp cứu. Mười bốn bác sĩ lâm sàng giàu kinh nghiệm trong lĩnh vực hồi sức cấp cứu, bao gồm bác sĩ, nhân viên thực hành nâng cao và dược sĩ, đã xem xét các câu trả lời của AI về độ chính xác, chất lượng diễn giải hình ảnh, lập luận lâm sàng và nguy cơ gây hại cho người bệnh.

Không có can thiệp nào được áp dụng ngoài việc AI trả lời câu hỏi; bối cảnh nghiên cứu mô phỏng môi trường thi nhằm đối chiếu ChatGPT-4o với hiệu năng của bác sĩ lâm sàng.

Kết quả chính

Độ chính xác chung: ChatGPT-4o đạt tỷ lệ trả lời đúng 74,9%, cao hơn có ý nghĩa thống kê so với tỷ lệ trả lời đúng gộp của bác sĩ lâm sàng là 71,1% (p = 0,03). Điều này cho thấy mô hình có năng lực tốt về kiến thức y khoa và khả năng hiểu câu hỏi.

Hiệu năng theo lĩnh vực: Độ chính xác cao nhất được ghi nhận ở bệnh phổi (91,7%), ngoại khoa và chấn thương (87,5%), và rối loạn thần kinh (81,8%). Ở các lĩnh vực này, việc hiểu câu hỏi tương đối tốt, nhưng độ chính xác giảm khi yêu cầu diễn giải hình ảnh.

Diễn giải hình ảnh: Hiệu năng của AI ở mức chưa tối ưu, với khả năng diễn giải hình ảnh đúng chỉ trong 61,7% trường hợp. Kết quả đặc biệt kém ở các câu hỏi về siêu âm hồi sức cấp cứu, với độ chính xác chỉ 51,1%. Những phát hiện này nhấn mạnh thách thức của LLM trong xử lý dữ liệu lâm sàng trực quan.

Lập luận lâm sàng và hỗ trợ: ChatGPT-4o cho thấy chất lượng lập luận ở mức trung bình (68,3%) và mức độ đầy đủ khi cung cấp thông tin hỗ trợ là 66,1%. Điều này cho thấy mặc dù mô hình hiểu tốt nội dung câu hỏi, nhưng khả năng tích hợp và vận dụng kiến thức y khoa vào lập luận vẫn còn hạn chế.

Nguy cơ gây hại: Đáng lưu ý, 33,3% các câu trả lời do AI tạo ra có liên quan đến nguy cơ gây hại lâm sàng, chủ yếu do diễn giải hình ảnh sai và khuyến nghị điều trị không phù hợp. Điều này đặt ra các mối lo ngại nghiêm trọng về an toàn khi dựa vào LLM trong ra quyết định lâm sàng hoặc giáo dục mà không có xác minh từ con người.

Bình luận chuyên gia

Nghiên cứu này là một trong những nghiên cứu đầu tiên đánh giá một cách nghiêm ngặt khả năng của một LLM tiên tiến trong việc xử lý các câu hỏi hồi sức cấp cứu đa phương thức trong điều kiện giống kỳ thi. Độ chính xác chung cao hơn so với nhóm bác sĩ lâm sàng gộp cho thấy khả năng ấn tượng của ChatGPT-4o trong việc tiếp thu lượng lớn kiến thức y khoa. Tuy nhiên, năng lực còn hạn chế của AI trong diễn giải hình ảnh lâm sàng—một nền tảng của thực hành hồi sức cấp cứu—lại cho thấy một khoảng trống quan trọng.

Các sai sót ở câu hỏi dựa trên hình ảnh và trong lập luận có thể liên quan đến những giới hạn vốn có của kiến trúc LLM hiện tại, vốn chủ yếu tập trung vào xử lý văn bản và được huấn luyện ít hơn trên dữ liệu hình ảnh hoặc việc tích hợp dữ liệu này vào bối cảnh lâm sàng. Nguy cơ đáng kể từ các khuyến nghị có thể gây hại nhấn mạnh nhu cầu phải thẩm định nghiêm ngặt trước khi đưa những mô hình như vậy vào quy trình làm việc lâm sàng hoặc các công cụ đánh giá giáo dục.

Các cải tiến trong tương lai có thể bao gồm các phương pháp huấn luyện đa phương thức được thiết kế rõ ràng để tích hợp hình ảnh lâm sàng và chẩn đoán với lập luận dựa trên văn bản. Cho đến khi đạt được điều đó, bác sĩ lâm sàng và nhà giáo dục nên tiếp cận đầu ra của LLM một cách thận trọng, bảo đảm có sự giám sát của con người nhằm giảm thiểu nguy cơ.

Kết luận

ChatGPT-4o cho thấy độ chính xác đầy hứa hẹn, vượt qua hiệu năng trung bình của bác sĩ lâm sàng trên các câu hỏi ôn thi hội đồng đa phương thức trong hồi sức cấp cứu, nhưng lại chưa đáp ứng ở các lĩnh vực then chốt là diễn giải hình ảnh và lập luận lâm sàng. Những hạn chế này góp phần tạo ra một tỷ lệ đáng kể các khuyến nghị có khả năng không an toàn, qua đó nhấn mạnh sự cần thiết phải áp dụng thận trọng trong môi trường lâm sàng.

Mặc dù LLM có tiềm năng như công cụ hỗ trợ giáo dục hoặc hỗ trợ ra quyết định, các hạn chế hiện tại đòi hỏi phải được chuyên gia con người xem xét. Việc tiếp tục phát triển khả năng tích hợp xử lý dữ liệu hình ảnh và lập luận lâm sàng phức tạp sẽ là yếu tố thiết yếu để khai thác các công nghệ này một cách an toàn và hiệu quả trong y học hồi sức cấp cứu.

Tài trợ và thử nghiệm lâm sàng

Nghiên cứu được trích dẫn được công bố mà không nêu rõ nguồn tài trợ và không báo cáo bất kỳ thử nghiệm lâm sàng can thiệp nào.

Tài liệu tham khảo

1. Sethi I, Khan S, Lyons PG, et al. Large Language Models Provide Accurate but Potentially Unsafe Answers to Multimodal Critical Care Medicine Board Review Questions. Crit Care Med. 2026;54(9):2245-2255. PMID: 42307255.
2. Topol EJ. High-performance medicine: the convergence of human and artificial intelligence. Nat Med. 2019;25(1):44-56.
3. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
4. Langlotz CP, Allen B, Erickson BJ, et al. A roadmap for foundational research on artificial intelligence in medical imaging: From the 2018 NIH/RSNA/ACR/The Academy Workshop. Radiology. 2019;291(3):781-791.

Bài viết này được tạo với sự hỗ trợ của nhiều công cụ biên tập, bao gồm AI, trong quá trình thực hiện. Nội dung đã được biên tập viên xem xét trước khi xuất bản.

Bài liên quan

Mở nguồn tin theo ngôn ngữ và trang theo chuyên khoa.

Phân tích sự khác biệt trong đánh giá kỹ năng giao tiếp giữa kỳ thi OSCE trực tuyến và trực tiếp đối với bác sĩ nội trú chuyên ngành Nội khoaNghiên cứu này sử dụng Lý thuyết Đáp ứng Mục để cho thấy rằng dù điểm giao tiếp tổng thể trong OSCE trực tuyến và trực tiếp tương tự nhau, một số mục giao tiếp cụ thể như giải thích thuật ngữ y khoa lại có ngưỡng thành thạo khác nhau giữa h28 thg 9, 2026AI phát hiện ảnh nâng mũi trực tuyến bị chỉnh sửa kỹ thuật số: Bước tiến mới trong minh bạch phẫu thuậtNghiên cứu này cho thấy gần 20% ảnh nâng mũi trực tuyến trên một nền tảng lớn đã bị can thiệp kỹ thuật số; một mô hình AI có độ chính xác cao đã phát hiện điều này, nhấn mạnh nhu cầu kiểm tra tính xác thực trong hình ảnh phẫu thuật thẩm mỹ.28 thg 9, 2026Góc nhìn của các bên liên quan về trí tuệ nhân tạo trong công việc chăm sóc tại nhà: Tổng quan dựa trên bằng chứngBài tổng quan này tổng hợp quan điểm của các bên liên quan chính về việc tích hợp AI trong chăm sóc tại nhà, làm nổi bật lợi ích, rủi ro và thách thức quản trị nhằm cung cấp cơ sở cho việc áp dụng AI một cách công bằng và bền vững.28 thg 9, 2026Ứng dụng di động y tế có AI và trò chơi hóa cải thiện kiểm soát huyết áp trong một đoàn hệ bệnh nhân ghép cặp
Loading comments...
MedXY briefing

Get the free newsletter

Evidence-led clinical news, trends, and analysis—delivered to your inbox.

Hỏi MedXY AI

Most popular

Ob/Gyn & Women's Health/Sản phụ khoa
Biến thiên toàn cầu về cắt tử cung đồng thời trong phẫu thuật giảm nguy cơ ở người mang BRCA1/2: Phân tích định lượng và định tính tích hợp
Tin tức MedXY
维生素D补充对慢性肝病影响的全面荟萃分析
Neurology/Thần kinh học
Kết nối corticostriatal tái tổ chức trước và sau khi suy giảm vận động trong bệnh Parkinson
Diabetes & Endocrinology/Bệnh tiểu đường và nội tiết
Phân tầng tiên lượng và kết cục trong di căn não từ ung thư tuyến giáp biệt hóa nguồn gốc từ tế bào nang không thoái sản: góc nhìn từ một nghiên cứu hồi cứu đa trung tâm
Cardiology/Tim mạch
Khởi trị, tuân thủ và duy trì điều trị suy tim theo khuyến cáo hướng dẫn sau nhập viện: Thu hẹp khoảng cách giữa kê đơn và sử dụng bền vững
© 2026 MedXY
Contact usAbout usPrivacy PolicyMedXY story
Nghiên cứu cho thấy việc sử dụng một ứng dụng di động y tế có yếu tố trò chơi hóa, được điều khiển bởi AI và tích hợp theo dõi huyết áp tại nhà, giúp cải thiện kiểm soát huyết áp đáng kể so với chăm sóc thường quy ở bệnh nhân tăng huyết áp.
18 thg 9, 2026
Đánh giá tác động thực sự của một năm nghiên cứu chuyên biệt đối với đầu ra học thuật của ứng viên nội trú Tai Mũi HọngBài viết này khảo sát liệu một năm nghiên cứu chuyên biệt có làm tăng đầu ra học thuật có ý nghĩa ở các ứng viên nội trú Tai Mũi Họng năm 2025 hay không, đồng thời cho thấy mức tăng chủ yếu nằm ở các công trình chưa công bố và vai trò tác g10 thg 9, 2026
Đánh giá tính chân thực của hình ảnh thanh quản videostroboscopy tổng hợp do StyleGAN3 tạo raNghiên cứu này đánh giá mức độ chân thực cảm nhận của hình ảnh thanh quản tổng hợp được tạo bằng StyleGAN3, cho thấy mức độ mơ hồ cao giữa các khung hình thật và tổng hợp, đồng thời nhấn mạnh thời gian huấn luyện tối ưu để tạo ảnh chân thực4 thg 9, 2026