Phân tích sự khác biệt trong đánh giá kỹ năng giao tiếp giữa kỳ thi OSCE trực tuyến và trực tiếp đối với bác sĩ nội trú chuyên ngành Nội khoa
Điểm nổi bật
Nghiên cứu này đánh giá việc lượng giá kỹ năng giao tiếp giữa các Kỳ thi Lâm sàng Cấu trúc Khách quan (Objective Structured Clinical Examination, OSCE) trực tuyến và trực tiếp ở các bác sĩ nội trú nội khoa bằng Mô hình Lý thuyết Đáp ứng Mục (Item Response Theory, IRT). Mặc dù điểm giao tiếp tổng thể giữa hai hình thức tương tự nhau, phân tích cho thấy các khác biệt theo từng nhiệm vụ về ngưỡng thành thạo, đặc biệt ở khả năng giải thích thuật ngữ y khoa. Những phát hiện này có ý nghĩa đối với việc thiết kế, diễn giải và so sánh các đánh giá OSCE giữa các hình thức khác nhau.
Bối cảnh nghiên cứu
Đánh giá giao tiếp lâm sàng là một thành phần then chốt của đào tạo và cấp chứng chỉ y khoa. Kỳ thi Lâm sàng Cấu trúc Khách quan (OSCE) là công cụ được sử dụng rộng rãi để đo lường các năng lực lâm sàng và giao tiếp cụ thể thông qua bệnh nhân chuẩn hóa (standardized patients, SPs) và thang điểm neo hành vi. Theo truyền thống được thực hiện trực tiếp, OSCE trực tuyến đã trở nên nổi bật, đặc biệt được thúc đẩy nhanh bởi đại dịch COVID-19, nhờ ưu thế về tính linh hoạt và khả năng tiếp cận. Tuy nhiên, các nghiên cứu trước đây chủ yếu so sánh điểm أداء tổng thể giữa OSCE trực tuyến và trực tiếp, mà chưa phân tích liệu các hành vi giao tiếp riêng lẻ có được đánh giá tương đương giữa các hình thức hay không. Khoảng trống này có thể che lấp những khác biệt tinh tế trong biểu hiện hoặc chấm điểm kỹ năng, từ đó ảnh hưởng đến tính giá trị và công bằng của các đánh giá dựa trên OSCE.
Thiết kế nghiên cứu
Nghiên cứu này phân tích dữ liệu từ 126 bác sĩ nội trú năm thứ nhất nội khoa sau đại học, được đánh giá qua sáu OSCE theo ca lâm sàng được thực hiện từ năm 2019 đến 2023. Trong số này, 82 lượt là trực tiếp và 54 lượt là trực tuyến. Để bảo đảm tính nhất quán, cùng một bộ ca nội khoa đã được sử dụng cho cả hai hình thức. Bệnh nhân chuẩn hóa chấm điểm giao tiếp của bác sĩ nội trú trên ba lĩnh vực: thu thập thông tin, phát triển mối quan hệ và giáo dục bệnh nhân, bằng thang đánh giá neo hành vi với ba mức thứ bậc: “không thực hiện”, “thực hiện một phần” hoặc “thực hiện tốt”. Kết cục bao gồm điểm trung bình theo lĩnh vực, phân bố mức chấm và, quan trọng nhất, các ngưỡng thành thạo ở cấp độ từng mục được ước tính bằng mô hình IRT phản hồi xếp hạng (graded response). Cách tiếp cận này định lượng mức thành thạo giao tiếp tiềm ẩn cần thiết để chuyển từ mức chấm này sang mức chấm khác ở từng mục. Việc so sánh các ngưỡng giữa hai hình thức bằng kiểm định Wald cho phép xác định những mục hoạt động khác nhau giữa các lượt trực tuyến và trực tiếp.
Kết quả chính
Điểm giao tiếp tổng thể và phân bố mức chấm không khác biệt có ý nghĩa thống kê giữa OSCE trực tuyến và trực tiếp, cho thấy hiệu quả tổng thể của hai hình thức là tương đương. Phần lớn bác sĩ nội trú thể hiện kỹ năng giao tiếp đủ tốt để đạt mức chấm “thực hiện một phần” hoặc “thực hiện tốt” ở đa số mục trong danh mục kiểm tra.
Tuy nhiên, phân tích ngưỡng IRT ở cấp độ từng mục cho thấy một hành vi giao tiếp cụ thể—“sử dụng từ ngữ bệnh nhân hiểu được và giải thích thuật ngữ y khoa”—có khác biệt có ý nghĩa về yêu cầu thành thạo giữa hai hình thức. Với mục này, bác sĩ nội trú cần mức năng lực giao tiếp tiềm ẩn thấp hơn để đạt mức “thực hiện một phần” trong các lượt trực tuyến so với trực tiếp (z = 3,92; p hiệu chỉnh = 0,001). Điều này cho thấy либо hình thức trực tuyến giúp dễ đạt mức nhận diện cơ bản hơn đối với kỹ năng này, либо người chấm áp dụng tiêu chuẩn khác nhau hoặc nhận thức khác nhau về hành vi này khi đánh giá trực tuyến. Các mục giao tiếp khác không cho thấy khác biệt ngưỡng có ý nghĩa thống kê.
Các kết quả này cho thấy mặc dù mô hình điểm tổng thể tương tự nhau, ý nghĩa của từng mức chấm—đặc biệt đối với các hành vi giao tiếp tinh tế—có thể không đồng nhất giữa các hình thức OSCE. Đây là một điểm cần lưu ý quan trọng đối với giảng viên và lãnh đạo chương trình khi diễn giải các kết quả đánh giá theo thời gian hoặc khi so sánh giữa các hình thức OSCE trực tuyến và trực tiếp.
Bình luận chuyên gia
Việc ứng dụng Lý thuyết Đáp ứng Mục trong đánh giá kỹ năng lâm sàng cung cấp một khung phân tích tinh vi, vượt ra ngoài các điểm số tổng hợp để khảo sát chức năng của từng mục. Nghiên cứu này cho thấy một cách thuyết phục rằng các tham số ngưỡng IRT có thể làm lộ ra những khác biệt tiềm ẩn trong tiêu chuẩn thành thạo giao tiếp gắn với hình thức OSCE.
Những khác biệt quan sát được trong việc giải thích thuật ngữ y khoa có thể xuất phát từ các thách thức đặc thù của bối cảnh trực tuyến—chẳng hạn như tín hiệu từ bệnh nhân bị thay đổi, hạn chế âm thanh-hình ảnh hoặc động lực tương tác khác—làm phóng đại hoặc che khuất năng lực của bác sĩ nội trú ở lĩnh vực này. Mặt khác, bệnh nhân chuẩn hóa có thể chấm điểm khác nhau do kỳ vọng hoặc nhận thức đặc thù của từng hình thức. Các nghiên cứu tương lai tích hợp chuẩn hóa đào tạo người chấm và phản hồi định tính từ người chấm sẽ giúp làm rõ các cơ chế này.
Quan trọng hơn, công trình này cảnh báo các nhà giáo dục y khoa về nguy cơ mặc nhiên coi điểm OSCE tương đương trực tiếp giữa các hình thức mà không có đánh giá tâm trắc học ở mức độ chi tiết. Khi đánh giá trực tuyến ngày càng phổ biến, các công cụ như phân tích ngưỡng IRT có thể hỗ trợ lập luận về tính giá trị và định hướng phản hồi hình thành phù hợp, biện pháp khắc phục, cũng như chiến lược ra quyết định tổng kết.
Kết luận
Nghiên cứu này cung cấp bằng chứng có ý nghĩa cho thấy mặc dù điểm năng lực giao tiếp tổng thể trong OSCE nội khoa dường như tương tự giữa hình thức trực tuyến và trực tiếp, các hành vi giao tiếp riêng lẻ có thể được chấm ở các mức thành thạo khác nhau tùy theo bối cảnh. Khác biệt được chứng minh trong việc giải thích thuật ngữ chuyên môn nhấn mạnh khả năng tồn tại sai lệch hoặc hiệu ứng tương tác đặc thù của từng hình thức trong đánh giá giao tiếp lâm sàng. Việc đưa phân tích ngưỡng IRT vào quá trình thẩm định OSCE sẽ mở rộng hiểu biết về tính tương đương của chấm điểm và giúp bảo đảm việc đánh giá kỹ năng giao tiếp của bác sĩ nội trú công bằng, chính xác, bất kể hình thức thi. Các chương trình giáo dục y khoa nên cân nhắc những sắc thái này khi thiết kế, diễn giải và chuyển đổi giữa các hình thức OSCE trực tuyến và trực tiếp nhằm duy trì tính toàn vẹn và ý nghĩa của việc đánh giá kỹ năng giao tiếp.
Về tài trợ và ClinicalTrials.gov
Bài báo gốc không nêu nguồn tài trợ hoặc thông tin đăng ký thử nghiệm lâm sàng.
Tài liệu tham khảo
Beltran CP, Nallamaddi S, Wilhite JA, Hardowar K, Hanley K, Altshuler L, Zabar SR, Gillespie C. When “Well-Done” Is Not the Same: Item Response Theory Analysis of Medicine Residents’ OSCE Communication Ratings Across Modalities. J Gen Intern Med. 2026 Sep 22. doi: 10.1007/s11606-026-4277-3. PMID: 42773393.
Cook DA, Holmboe ES. Translating OSCE scores into meaningful judgments: the promise of item response theory models. Med Educ. 2015 Feb;49(2):115-7. doi:10.1111/medu.12634.
Bokken L, Rethans JJ, van Heurn L, et al. Virtual patients in medical education: design and dimensions for research. Adv Health Sci Educ Theory Pract. 2010 Aug;15(3):495-502. doi:10.1007/s10459-009-9190-1.
Hawkins RE, Perfetto J, Brandt B, et al. Exploring best practices for equating scores from multiple assessment methods. Acad Med. 2015 Jul;90(7):932-8. doi:10.1097/ACM.0000000000000711.
Bài viết này được tạo với sự hỗ trợ của nhiều công cụ biên tập, bao gồm AI, trong quá trình thực hiện. Nội dung đã được biên tập viên xem xét trước khi xuất bản.
