OPEN MODELS & DATASETS
医療AIを、オープンで。
Hugging Faceで公開しているモデルとデータセット。日本語の医療テキストを検索できる埋め込みモデルを土台に、その検索を使ってガイドラインの新旧差分データを作り、臨床文書を書くときの補完モデルまで積み上げてきました。マンガの吹き出しを読むOCRは、その過程で身についた小型モデルの学習を、医療の外で試した一本です。
Models

Baberu OCR
Apache-2.0115Mパラメータでマンガの吹き出しを読む。日中英に対応し、日本語では蒸留元の教師モデルを上回った。8倍サイズのモデルとも吹き出し単位では互角。
115M日中英で教師モデル超え→
med-ruri v3
埋め込み日本語の医療文書を検索するための埋め込みモデル。ModernBERT-Jaを医療ドメインで追加学習。8つのサイズ・系統を公開し、院内RAGや上のデータセット作りの検索基盤に使っている。
nDCG 0.53医療の埋め込みモデル→

med-lfm2.5 autocomplete
1.2Bカルテや退院サマリーを書くときに、続きを先読みして提案する補完モデル。LiquidAIのLFM2.5を土台に、医療テキストで4段階の追加学習。オフラインのCPUでも動く軽さにした。
1.2Bオフラインで動く補完→
Datasets

med-slm-ja Before / After
CC BY 4.0日本の診療ガイドライン201冊・2010〜2024年の改訂をたどり、旧版と新版で答えがどう変わったかを新旧の出典つきで収録したデータセット。臨床的に答えが変わった7,042件を含む46,705組。ライブデモで実例を見られる。
46,705組♥101 · 46.7k DL/月→
US Clinical Guidelines
19 学会 · 23,600行
NCCN・ACC/AHA・ADA ほか。英語版の新旧差分データ。
med-guideline-temporal-en
CC BY-NC 4.0上の日本語データセットの英語版。米国19学会・121シリーズの改訂を追い、推奨がどう変わったかを構造化した。時間軸に強い検索モデルの学習や、知識の陳腐化の評価に。
23,600行米国19学会 · CC BY-NC→