仮想OSCEと対面OSCEで「十分実施」の意味は同じか:研修医のコミュニケーション評価を読み解く
注目ポイント
本研究では、Item Response Theory(IRT)を用いて、内科系研修医を対象に、仮想形式および対面形式のObjective Structured Clinical Examination(OSCE)におけるコミュニケーション技能評価を検討した。全体としてのコミュニケーション評価は両形式で同程度であった一方、解析により、医療用語をかみ砕いて説明する能力など、課題別に習得水準の閾値が異なることが示された。これらの結果は、OSCEを異なる形式で設計・解釈・比較する際に、よりきめ細かな評価が必要であることを示唆している。
研究背景
臨床コミュニケーションの評価は、医学教育および認定における重要な構成要素である。Objective Structured Clinical Examination(OSCE)は、標準化患者(standardized patient, SP)と行動指標に基づく評価尺度を用いて、特定の臨床能力およびコミュニケーション能力を測定する広く用いられている手法である。従来は対面で実施されてきたが、特にCOVID-19パンデミックを契機として、柔軟性とアクセス向上の利点を有する仮想OSCEの重要性が高まっている。しかし、先行研究の多くは仮想形式と対面形式のOSCEにおける全体得点の比較にとどまり、個々のコミュニケーション行動が両形式で同等に評価されているかどうかは十分に検討していない。この欠落は、技能発揮や評価における微妙な差異を見逃すおそれがあり、OSCEに基づく評価の妥当性や公平性に影響し得る。
研究デザイン
本研究では、2019年から2023年に実施された6件の症例ベースOSCEで評価された、卒後1年目の内科系研修医126名のデータを解析した。そのうち82件は対面、54件は仮想形式であった。比較可能性を保つため、両形式で同一の内科症例を使用した。標準化患者は、情報収集、関係形成、患者教育の3領域にわたり、3段階の順序尺度「未実施」「一部実施」「十分実施」を用いて研修医のコミュニケーションを評価した。アウトカムには、各領域の平均得点、評価分布、ならびにgraded response型のItem Response Theory(IRT)モデルによって推定した項目レベルの習得閾値が含まれた。この手法により、各項目で評価カテゴリーを移行するのに必要な潜在的コミュニケーション能力を定量化できる。さらに、Wald検定を用いて両形式間の閾値を比較することで、仮想および対面の受診場面で異なる機能を示す項目を特定した。
主な結果
全体のコミュニケーション得点および評価分布には、仮想OSCEと対面OSCEの間で有意差は認められず、両形式で総合的な成績は同程度であることが示唆された。大多数の研修医は、チェックリスト項目の多くにおいて「一部実施」または「十分実施」の評価を得るのに十分なコミュニケーション技能を示した。
しかし、項目レベルのIRT閾値解析では、「患者が理解できる言葉を用い、医療用語を説明する」という特定のコミュニケーション行動において、形式間で必要とされる習得水準に有意差が認められた。この項目では、仮想場面のほうが対面場面よりも、研修医が「一部実施」の評価を得るために必要な基礎的コミュニケーション能力が低かった(z = 3.92、調整済みp = 0.001)。これは、仮想形式がこの技能の基本的な達成を容易にしている可能性、あるいは評価者が仮想評価では異なる基準を適用している、もしくはこの行動を異なる形で認識している可能性を示している。他のコミュニケーション項目では、統計学的に有意な閾値差は認められなかった。
これらの所見は、全体得点のプロファイルが類似していても、特に繊細なコミュニケーション行動に関しては、個々の評価の意味がOSCEの形式間で必ずしも一様ではないことを示している。これは、仮想形式と対面形式を切り替えて使用する場合、あるいは両者を組み合わせて用いる場合に、縦断的評価や比較評価の結果を解釈する教育者やプログラム責任者にとって重要な留意点である。
専門的考察
臨床技能評価におけるItem Response Theoryの応用は、総得点を超えて項目の機能を解析する高度な枠組みを提供する。本研究は、IRTの閾値パラメータによって、OSCEの形式に結び付いたコミュニケーション能力基準の潜在的差異を明らかにできることを、的確に示している。
医療用語の説明に見られた差異は、仮想受診場面特有の課題、すなわち患者の反応手がかりの変化、音声・映像の制約、あるいは相互作用の力学の変化などに起因する可能性がある。これらは、この領域における研修医の能力を過大にも過小にも見せ得る。あるいは、標準化患者が形式特有の期待や認識に基づいて、この行動を異なる基準で評価していた可能性もある。今後は、評価者訓練の標準化と質的フィードバックを組み込んだ研究が、こうした機序の解明に役立つだろう。
重要なのは、詳細な心理計量学的評価を行わずに、OSCE得点が各形式で直接同等であるとみなすことのリスクを、医学教育関係者に警告している点である。仮想評価がますます普及するなか、IRTの閾値解析のような手法は、妥当性の根拠形成を支援し、個別化された形成的フィードバック、補習、総括的判断の戦略を導くうえで有用である。
結論
本研究は、内科OSCEにおけるコミュニケーション能力の総合得点は、仮想形式と対面形式で概ね同程度である一方、個別のコミュニケーション行動は、文脈によって異なる習得水準で評価され得ることを示す重要なエビデンスを提供した。医療用語の説明における有意差は、臨床コミュニケーション評価における形式特異的バイアス、あるいは相互作用の影響の可能性を示している。OSCEの妥当性検証にIRT閾値解析を組み込むことで、採点の同等性に対する理解が深まり、試験形式にかかわらず研修医のコミュニケーション技能を公正かつ正確に評価することが可能となる。医学教育プログラムは、コミュニケーション技能評価の整合性と意義を維持するために、仮想形式と対面形式のOSCEを設計・解釈・移行する際、これらの差異を考慮すべきである。
資金提供およびClinicalTrials.gov
原著論文では、資金提供元および臨床試験登録の詳細は記載されていなかった。
参考文献
Beltran CP, Nallamaddi S, Wilhite JA, Hardowar K, Hanley K, Altshuler L, Zabar SR, Gillespie C. When “Well-Done” Is Not the Same: Item Response Theory Analysis of Medicine Residents’ OSCE Communication Ratings Across Modalities. J Gen Intern Med. 2026 Sep 22. doi: 10.1007/s11606-026-4277-3. PMID: 42773393.
Cook DA, Holmboe ES. Translating OSCE scores into meaningful judgments: the promise of item response theory models. Med Educ. 2015 Feb;49(2):115-7. doi:10.1111/medu.12634.
Bokken L, Rethans JJ, van Heurn L, et al. Virtual patients in medical education: design and dimensions for research. Adv Health Sci Educ Theory Pract. 2010 Aug;15(3):495-502. doi:10.1007/s10459-009-9190-1.
Hawkins RE, Perfetto J, Brandt B, et al. Exploring best practices for equating scores from multiple assessment methods. Acad Med. 2015 Jul;90(7):932-8. doi:10.1097/ACM.0000000000000711.
この記事は、制作工程の一部でAIを含む複数の編集ツールを使用して作成され、公開前に人間の編集者が内容を確認しています。
