ФФМ МГУ
Аккредитация · ОСКЭ · Система оценки

Объективность весов чек-листов ОСКЭ: трёхшаговая робастная процедура согласования экспертных оценок

Хохлов И.В.
ассистент Кафедры клинического моделирования и мануальных навыков
ФФМ МГУ имени М.В. Ломоносова, Москва

Росомед 2026

Как расставить весовые коэффициенты?

Начнём с простой аналогии из повседневной жизни

У всего в мире есть «цена». Одни вещи стоят дороже, другие — дешевле. Действия тоже можно мыслить как «цены» и «штрафы».

Хлеб, автомобиль, дом — разная ценность
Весовой коэффициент пункта чек-листа — это «цена» действия студента: насколько оно важно для итоговой оценки.

Бонусы и штрафы

Деньги приходят — или уходят
Работа приносит доход

«Плюс» — бонус

Работа приносит доход. Чем ценнее вклад — тем больше денег на счёт.

Полезное действие студента → положительный коэффициент.

Штраф за нарушение ПДД

«Минус» — штраф

Нарушение ПДД — штраф. Чем тяжелее нарушение — тем больше списание.

Вредное действие → отрицательный коэффициент.

Что-то стоит дороже, что-то — дешевле

Шкала ценности

Хлеб < автомобиль < дом. Разная ценность — разный «плюс».

«Наложил повязку» < «остановил кровотечение» < «обеспечил проходимость дых. путей».

Шкала штрафов

Штраф за мусор < лишение свободы. Разный вред — разный «минус».

«Не записал время жгута» < «переместил при травме позвоночника».

Действия студента тоже имеют «цену»

Переход к чек-листу OSCE
Действие студента и коэффициент

Каждый пункт чек-листа — конкретное действие на станции. Эксперт оценивает: сколько «стоит» выполнение или невыполнение этого действия для итогового балла.

Один товар — разная цена в разных странах

Культура, логистика, спрос — всё влияет

Килограмм риса или хлеба стоит по-разному — в зависимости от того, где вы его покупаете:

Базар в Индии
≈ 40 ₹
Индия
Супермаркет в Германии
≈ 2.50 €
Германия
Рынок в Египте
≈ 25 EGP
Египет
Базар в Турции
≈ 35 ₺
Турция
Эксперт = страна. Цифры разные — но это один и тот же товар. Нужен способ сравнить цены между странами.

Разные деньги — разные «шкалы»

Рубль, евро, доллар, рупия

Рубли, евро, доллары, рупии — разные системы счёта. Число «100» в одной валюте не равно «100» в другой.

Так же эксперты могут оценивать в «рублях» (0–100), «долларах» (0–10) или «рупиях» (0–45).

Курсы валют — система «нормализации»

Приводим разные шкалы к единому знаменателю
Табло курсов валют

Чтобы сравнить цены из Индии и Германии, мы используем курс обмена — переводим всё в одну «валюту».

Нормализация экспертных оценок — тот же принцип:
эксперт = страна · шкала = валюта · обмен = нормализация → единая шкала −100…+100.
После обмена килограмм риса в Индии и Германии всё ещё может стоить по-разному. Нормализация сравнивает шкалы, а не заставляет экспертов согласиться.

От аналогии — к формальной процедуре

Экспертыкаждый «в своей
валюте»
→
Нормализация«курс обмена»
→ шкала −100…+100
→
Медиана + IQRконсенсусный вес
и разногласие
  • 8 независимых экспертов × 18 пунктов чек-листа «Первая помощь при травме».
  • Робастная процедура: устойчива к выбросам, даёт объективные критерии утверждения весов.

Актуальность

Почему недостаточно «просто усреднить»
  • Итоговый балл ОСКЭ зависит от субъективно назначаемых весов пунктов чек-листа.
  • Арифметическое среднее чувствительно к выбросам: один голос может обесценить жизненно важное действие.
  • Эксперты используют разные шкалы — без нормализации оценки несопоставимы (как цены в разных валютах).
  • При малом n разброс не позволяет отличить согласие от случайности.

Цель

Разработать и апробировать трёхшаговую робастную процедуру согласования весовых коэффициентов с раздельной оценкой:

Экспертное согласие

IQR — насколько единообразны мнения экспертов по пункту.

Статистическая надёжность

95% ДИ медианы (Olive, 2005) — насколько обоснован консенсус при ограниченном n.

Материалы

Апробация на чек-листе «Первая помощь при травме»
18
пунктов чек-листа
8
независимых экспертов
3
этапа процедуры
  • Чек-лист по официальному перечню мероприятий первой помощи при травме.
  • Матрица оценок xij (i — пункт, j — эксперт).
  • Сбор — веб-форма; расчёты и boxplot — «Конструктор чек-листов» симуляционного центра.

Шкала экспертных оценок

«Валюта» эксперта — любые вещественные числа

Положительное «+»

Действие полезно; чем больше — тем важнее.
«остановил кровотечение»

Ноль «0»

Действие нейтрально.
«моргнул во время задания»

Отрицательное «−»

Действие вредно; чем больше модуль — тем сильнее штраф.
«нахамил пациенту»

Шкалы: 0–10, −100…+100, −7,9…1 млн… Ноль — единственный общий «якорь» (как базовая валюта для курса).

Когда оценить очень сложно

Экстремальные «раритеты» — Моне и гостайна
Картина Моне

Выброс «+» — картина Моне

Шедевр бесценен, но один скажет 10 млн, другой — 100 млн. Масштаб разный, направление — одно.

Гостайна

Выброс «−» — продажа гостайны

Все согласны: чудовищно. Но «насколько» — разброс в величине штрафа.

Трёхшаговая процедура

Этап 1Независимый сбор
сырых баллов
→
Этап 2Робастная
нормализация
→
Этап 3Медиана, IQR,
95% ДИ (Olive)

Эксперты не видят чужих оценок. Каждый — «в своей валюте».

«Курс обмена»: шкалы → −100…+100. Выбросы не усекаются.

Консенсусный вес Mi, разногласие IQRi, надёжность — 95% ДИ.

Этап 1. Сбор сырых баллов

Какое задание получает эксперт
1

Каждый эксперт независимо оценивает значимость всех 18 пунктов для итоговой оценки.

2

Эксперт не видит чужих оценок и итоговых весов — снижается эффект якорения.

3

Допускаются любые вещественные числа по произвольной шкале. Знак числа — смысл действия:

Плюс «+»

Действие полезно; чем больше число — тем важнее.
«остановил кровотечение»

Ноль «0»

Действие нейтрально, не влияет на оценку.
«моргнул во время задания»

Минус «−»

Действие вредно; чем больше модуль — тем сильнее штраф.
«нахамил пациенту»

Результат: матрица xij размером 18 × 8 (пункты × эксперты).

Если эксперта не ограничить

Одни и те же 18 пунктов — каждый ставит баллы как считает нужным

Эксперт А

Держится в небольших числах

Эксперт Б

Большая часть оценок от 25 до 100, но есть аномалия 500

Эксперт В

Ставит как «+», так и «−» баллы

Эксперт Г

Использует десятичные дроби в оценке

Эксперт Д

Только 0 и 1

Эксперт Е

Использует в системе оценки цифры от 1 до 5

Этап 2. Робастная нормализация

По столбцам (внутри каждого эксперта)

Для ненулевых модулей столбца j:

IQR = Q3 − Q1   |   B = Q3 + 3·IQR   |   Dj = max{|x| : |x| ≤ B}
zij = (xij / Dj) × 100    (для xij ≠ 0)
  • Типичные оценки попадают в диапазон −100…+100.
  • Выбросы (|x| > B) не усекаются — сохраняется информация о нетипичных, но обоснованных суждениях.
  • Нормализация применяется при ≥ 4 ненулевых значениях в столбце; иначе — сырые баллы.
  • Dj — максимальный типичный модуль (не медиана, не MAD): +100 = наиболее значимое типичное действие данного эксперта.

Этап 2. Пример расчёта

Один эксперт, 6 пунктов, «своя валюта» 0…500
ПунктСырой xТипичный?z = x / 50 × 100
A10да20
B20да40
C30да60
D40да80
E — «якорь»50да, это Dj100
F — выброс500нет: |x| > B1000

Q1 = 22,5   Q3 = 47,5   IQR = 25
B = Q3 + 3·IQR = 122,5
Dj = max{|x| ≤ B} = 50

Типичный максимум эксперта стал +100. Выброс 500 не отрезали: он стал 1000 и будет виден на boxplot, но не сломает медиану на этапе 3.

Этап 3. Агрегация

По строкам (по каждому пункту)

Из нормализованных значений zij для пункта i вычисляются:

ПоказательНазначение
Mi — медианаКонсенсусный вес пункта
Q1, Q3, IQRiМера содержательного разногласия экспертов
95% ДИ медианы (Olive, 2005)Мера статистической надёжности при малом n
Консенсусный вес — медиана Mi. Разногласие — IQR. Надёжность — 95% ДИ. Подробнее на следующих слайдах.

Почему среднее арифметическое не работает

Один выброс обесценивает жизненно важное действие

Пункт «Остановил кровотечение»: 7 экспертов дают высокие оценки, 1 эксперт — аномально низкую.

Среднее арифметическое ✗

Среднее падает с 95 до 84 — пункт кажется «несущественным»

Медиана ✓

Медиана остаётся 95 — консенсус не искажён одним голосом

Оценки экспертов Выброс Среднее Медиана
Точка поломки: среднее — 1/n (один выброс), медиана — ≈50% (нужно исказить почти половину оценок).

Когда медиана ещё ненадёжна

При n < 6 количественный консенсус — предварительный

n = 3 эксперта ✗

Три эксперта: −20, 5, 100 → медиана = 5.
95% ДИ ≈ размах [−20; 100] — не информативен.

n = 8 экспертов ✓

Тот же выброс (−20) среди 8 экспертов: медиана = 91.
95% ДИ [89; 100] — консенсус статистически обоснован.

  • При n = 3 медиана выдерживает только один выброс.
  • Квартили по 3–4 значениям нестабильны — IQR зашумлён.
  • → Для формального утверждения весов рекомендуется ≥ 6 экспертов (в апробации n = 8).

Чем больше экспертов — тем уже 95% ДИ

Одна и та же «истина» ≈ 90, один упрямый выброс −20

n = 3

n = 10

n = 30

n = 100

При n = 3 ДИ ≈ весь размах (почти бесполезен). При n = 100 медиана стоит около 90, а полоса ДИ узкая — консенсус уже точный.

Почему квартили и IQR, а не размах или σ

Размах (min–max)

Это расстояние от самого маленького числа до самого большого. Его задают всего две точки. Один экстремал (−20 при остальных ~90) — и «разногласие» кажется огромным, хотя спорит один человек.

Стандартное отклонение σ

Это «средний разброс вокруг среднего». Как и само среднее, σ ломается от одного выброса: экстремал тянет среднее и раздувает «разброс». Клиницисту такое число трудно прочитать.

IQR = Q₃ − Q₁

Отсортировали оценки. Отбросили нижнюю четверть и верхнюю четверть. Осталась середина (50% голосов). Ширина этой середины — IQR. Крайние мнения в неё не входят.

Ящик Q₁–Q₃ (средние 50%) Медиана M Выброс (не входит в IQR) σ «раздувается» из-за выброса
Коротко: IQR отвечает на вопрос «согласны ли типичные эксперты?». 95% ДИ медианы — на вопрос «достаточно ли у нас экспертов, чтобы этой медиане верить?». Это разные вопросы.

Boxplot: три пункта из апробации

Нормализованные оценки 8 экспертов, n = 8

Определил наличие дыхания Утверждён

Приложил холод к месту травмы На обсуждение

Переместил при подозрении на травму позвоночника Штраф утверждён

Узкий ящик → согласие экспертов  |  Широкий ящик → содержательные разногласия  |  M < 0 → штрафной вес

Результаты

Чек-лист «Первая помощь при травме», n = 8 экспертов
15
пунктов — вес утверждён
3
пункта — на очное обсуждение
0
выбросов, сместивших медианы

Произвольные вещественные диапазоны экспертов приведены к единой шкале −100…+100. Единичные выбросы (за границей B) не изменили консенсусные медианы.

Интерпретация boxplot → решение

Пункт Mi IQR 95% ДИ Boxplot Решение
Определил наличие дыхания +95 10 [89; 100] Утверждён
Приложил холод к месту травмы +45 50 [15; 75] На обсуждение
Переместил при подозрении на травму позвоночника −90 20 [−100; −78] Штраф утверждён
  • Узкий IQR + узкий ДИ → утверждение веса (дыхание).
  • Широкий IQR при n ≥ 6 → клинические разногласия, не «мало данных» (холод).
  • ДИ не пересекает ноль → штраф статистически обоснован (позвоночник).

Правила принятия решений

IQR — содержательное согласие

  • Узкий IQR → эксперты едины в оценке значимости.
  • Широкий IQR при n ≥ 6 → клинические разногласия, а не «мало данных».

95% ДИ — статистическая надёжность

  • Узкий ДИ → консенсус статистически обоснован.
  • Узкий IQR + широкий ДИ (обычно n < 6) → консенсус предварительный.
IQR и ДИ выполняют разные взаимодополняющие функции — их сочетание задаёт прозрачные правила утверждения весов по каждому пункту.

Обсуждение

Отличие от метода Дельфи

Одношаговая процедура — без повторных раундов. Эксперты оценивают один раз, не подстраиваясь под групповой консенсус.

Отличие от W Кендалла

Коэффициент конкордации оценивает согласие по чек-листу в целом. IQR и ДИ дают попунктную диагностику для пересмотра конкретных позиций.

  • Отрицательные веса позволяют штрафовать деструктивные действия — критично для безопасности и коммуникативных навыков.
  • Расчёты и boxplot реализованы в веб-приложении «Конструктор чек-листов» симуляционного центра.

Ограничения: рекомендуется n ≥ 6

При n < 6 количественные консенсусы следует считать предварительными:

  1. При n = 3 доверительный интервал медианы фактически совпадает с размахом оценок и не отражает положение консенсуса. Лишь при n ≥ 6 ДИ сужается достаточно.
  2. При n = 3 медиана выдерживает только один выброс — двух аномальных оценок достаточно для смещения итога.
  3. Квартили и IQR по 3–4 значениям нестабильны — мера согласия зашумлена.
В данной апробации n = 8 — процедура формально применима; для 3 пунктов широкий IQR отражает содержательные разногласия, а не недостаток экспертов.

Выводы

  1. Объективность весов чек-листа ОСКЭ достигается трёхшаговой процедурой: сырые баллы → робастная нормализация → медиана с квартилями и ДИ.
  2. Оценки — произвольные вещественные числа; несоизмеримость шкал устраняется нормализацией, общий «якорь» — ноль.
  3. IQR — мера экспертного согласия; 95% ДИ медианы (Olive) — мера статистической обоснованности; их сочетание задаёт прозрачные правила утверждения весов.
  4. Для формального утверждения весов рекомендуется ≥ 6 независимых экспертов.

Как считается итоговый балл студента

Консенсусный вес пункта — медиана Mi после трёх шагов
% = набранные плюсы / сумма всех плюсов  −  набранные штрафы / сумма всех штрафов

Правила вклада

  • Mi > 0 — бонус: если студент выполнил пункт, в числитель идёт Mi.
  • Mi < 0 — штраф: если сделал вредное действие, вычитается |Mi|.
  • Mi = 0 — пункт не влияет на балл.
  • Невыполненный плюс = 0. Несовершённый штраф = 0.
ПунктMiСтудентВклад
Определил дыхание+95сделал+95
Наложил повязку+40не сделал0
Перенёс при травме позвоночника−90не сделал0

Σ плюсов = 95 + 40 = 135  ·  набрано 95
Σ штрафов = 90  ·  набрано 0
% = 95/135 − 0/90 ≈ +70%

+100% — все полезные пункты выполнены. −100% — ни одного плюса и все штрафные действия совершены. Если в примере ещё и «перенёс позвоночник»: 95/135 − 90/90 ≈ −30%.
ФФМ МГУ
Спасибо за внимание

Вопросы?

Хохлов И.В.
Кафедра клинического моделирования и мануальных навыков
ФФМ МГУ имени М.В. Ломоносова, Москва

Чек-лист «Первая помощь при травме»:
medsimhub.ru/stations/pervaya-pomoshch-pri-travme