๐Ÿฅ Medical Triage Assistant

Compare LLM training paradigms on ESI triage classification (MIETIC-36 expert set):

Model Base Stage Exact / Adjacent
SFT Stage 1โ€“2 Qwen3.5-9B SFT on PubMed QA + clinical notes โ€”
DPO Stage 3 Qwen3.5-9B Preference optimization โ€”
GRPO v46 Qwen3.5-9B SFT + GRPO 77.8% / 94.4%
GRPO v49 Qwen3.5-9B SFT + rule-aware GRPO 77.8% / 100.0%
MedGemma 4B GRPO medgemma-4b-it SFT + rule-aware GRPO 83.3% / 97.2% โ† best

โš ๏ธ Research demo only โ€” not for clinical use. Always consult a qualified clinician.

Model

SFT = supervised fine-tuning ยท DPO = preference optimization ยท GRPO = RL on ESI rewards

Show model's step-by-step reasoning (Qwen3 extended thinking)

0 1
64 2048
Example Scenarios