Các mô hình nền tảng thu hẹp khoảng cách kiến thức trong nhãn khoa nhưng gặp khó khăn với hình ảnh
Nổi bật
• Trong một đánh giá ngang hàng về các câu hỏi chuẩn bị cho kỳ thi Phần 2 của Hiệp hội Hoàng gia về Nhãn khoa (FRCOphth), bảy mô hình nền tảng (FMs) đã thể hiện hiệu suất cao đối với các câu hỏi trắc nghiệm chỉ dựa trên văn bản; mô hình FM hiệu suất cao nhất (Claude 3.5 Sonnet) đạt độ chính xác 77,7%, tương đương với các bác sĩ nhãn khoa chuyên nghiệp.
• Hiệu suất đa phương thức (câu hỏi bao gồm hình ảnh hoặc đầu vào không phải văn bản khác) vẫn thấp đáng kể: mô hình FM đa phương thức hàng đầu (GPT-4o) đạt 57,5%, kém hơn so với các bác sĩ lâm sàng và thực tập sinh.
Đăng nhập miễn phí để đọc tiếp
Đăng nhập hoặc tạo tài khoản MedXY để đọc toàn bộ bài viết.
Bài viết này được tạo với sự hỗ trợ của nhiều công cụ biên tập, bao gồm AI, trong quá trình thực hiện. Nội dung đã được biên tập viên xem xét trước khi xuất bản.