Original title: Building safer clinical agents: the case for residency-level benchmarks in medical artificial intelligence
- 医療AIを安全に運用するために、レジデンシーレベルの行動指向型ベンチマークの必要性を提唱している。
- 医学的知識だけでは安全な運用実践には繋がらないとし、エージェントシステムが実際の臨床現場で安全に何ができるかを評価する重要性を訴える。
- 予測精度に留まらない、より厳密な評価基準の確立を求めている。