OpenOnco
UA EN
← Усі новини
17 травня 2026 engine quality audit

85% умов у деревах рішень engine не міг прочитати

Аудит усіх алгоритмів лікування показав, що більшість умов розгалуження написані англійською прозою, яку engine не вміє обчислювати, — і що через це 30% алгоритмів на кожному пацієнті провалювалися до значення за замовчуванням.

Написано ретроспективно, опубліковано 19 липня 2026.

Дерево рішень розгалужується за умовами. Наші часто були написані ось так — EGFR L858R or other classical sensitizing mutation — що чудово читається лікарем і нічого не означає для обчислювача умов, який розпізнає лише пласкі ключі знахідок. Умова, яку він не може розпізнати, обчислюється як «хибно».

Ми просканували всі файли алгоритмів, щоб зрозуміти масштаб. Числа виявилися гіршими, ніж очікувалося, — і гіршими за нашу ж першу оцінку. Початкова вибірка з перших 30 алгоритмів дала 27% таких, що провалюються на кожному пацієнті; повний обхід усіх 152 підняв цю цифру до 30%. Нижче наведено виправлені числа.

Що показав аудит

  • Просканували 152 файли алгоритмів, у них 443 вільнотекстові рядки condition:.
  • 376 з них — 85% — мають форму прози, тобто обчислювач повертає «хибно» замість справжньої відповіді.
  • 45 зі 152 алгоритмів (30%) мають перший крок, що складається виключно з прози. Вони провалюються до індикації за замовчуванням на кожному пацієнті, через що їхнє розгалуження стає декоративним.
Це справжній функціональний дефект, а не косметичний. Алгоритм, який завжди повертає значення за замовчуванням, нічого не маршрутизує — хоч би як ретельно були написані його гілки.

Що змінилося одразу

Тепер engine попереджає, коли зустрічає умову у формі прози, замість мовчки обчислювати її як «хибно». Це перетворює невидиму помилку на видиму — найдешевший корисний крок. Повний аудит опубліковано у docs/reviews/openonco-state-audit-2026-05-17.md.

Чому виправлення повільне

Переписати 376 умов у структуровану форму — це не пошук із заміною. Кожна кодує клінічний намір, який треба виразити через finding або red flag, не змінивши змісту, — а за власними правилами цього проєкту LLM не має права приймати таке рішення. Тому чергу опрацьовують хвороба за хворобою, з клінічною перевіркою.

Ми публікуємо це число, не чекаючи, доки воно стане приємним. Інструмент, який просить лікарів перевіряти його міркування, зобовʼязаний показувати їм і власні найгірші виміри.

Коментарі

Гілки публічні й індексуються — будь ласка, не пишіть у них персональні медичні дані. Знайшли клінічну помилку? Відкрийте issue.

Коментарі ще не увімкнено — бекенд потрібно налаштувати.