Original title: Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases
- 大規模言語モデル(LLM)は、管理業務の自動化から臨床意思決定の強化に至るまで、医療分野で変革をもたらすツールとして期待されている。
- LLMの広範かつ安全な臨床導入のためには、その厳格な評価が不可欠である。
- 本研究は、実際の臨床症例において、医師とAIがLLMの評価で異なる見解を示すことを指摘している。