Масштаб национальной базы: что даёт сотня миллионов животных и чего лишены мы

Стомиллионное животное с записями продуктивности — 2024 год, тринадцать миллионов генотипов — июнь 2026, три миллиона лактаций в год из девяти тысяч стад. Наш индекс стоит на базе CDCB-2025-metric, то есть на их числах — разбираем, что этот масштаб даёт оценкам и что мы обязаны завести, чтобы перестать брать базу взаймы.

Дмитрий Васин · 5 сентября 2026 г.

Работа

прочитан полный текст

National Cooperator Database. Описание базы, статистика и порядок обеспечения качества данных

Авторы
Council on Dairy Cattle Breeding — ведомственная публикация, авторы отдельных страниц не подписаны
Где и когда
Council on Dairy Cattle Breeding (CDCB), uscdcb.com, 2026
Выборка
Стомиллионное животное с записями продуктивности — 2024; 13 млн генотипированных животных на июнь 2026, из них 88 % голштинов и 93 % самок; 3,07 млн лактаций за 2025; 3,79 млн коров в 9 289 стадах DHI; 76 стран, 12 пород, более 60 организаций-поставщиков
Что мы прочли
Прочитан полный текст

Зачем это книге

Какой оценке быка верить и с какой надёжностью её публиковать

Ассоциация · При каждом пересчёте оценок и при выпуске каталога

Как решают сегодня
По оценкам, которые пришли вместе с быком, — чаще всего зарубежным и посчитанным на чужой популяции. Своей базы сравнения нет, поэтому сопоставлять быков между собой приходится на веру.
Чего это стоит
Пока база чужая, любая наша оценка верна ровно настолько, насколько наше поголовье похоже на американское, и проверить эту похожесть нечем. Хуже того, чужая база молча стареет: её пересчитают там, а мы узнаем об этом из чужого письма.
Что изменит работа
Оценка перестаёт быть взятой взаймы. Сейчас наш индекс стоит на базе CDCB-2025-metric, то есть быки сравниваются между собой по чужой популяции; работа показывает, какой масштаб за этой базой стоит и чего стоило бы собрать свою.
Чем книга помогает уже
Племенной индекс по признакам базы, надёжность R = n/(n+k), база сравнения с версией и датой

Решение выбрано из пяти, которые книга берётся обеспечивать (список — в шапке раздела). Работа, под которую не подходит ни одно из них, в раздел не берётся: без такого фильтра сюда годится любая статья, потребовавшая от нас данных, — а требует их любая.

Что утверждает работа

Это не научная работа, а публикация владельца базы о собственной базе, и читать её надо соответственно: числа тут не результат исследования, а отчётность. Мы взяли её в раздел не ради выводов, а ради одного факта, который проверяется в нашем собственном коде: версия базы, на которой считается наш индекс, называется «CDCB-2025-metric», и генетические стандартные отклонения в ней — переведённые в килограммы числа из Net Merit 2025.

Что утверждает публикация: масштаб позволяет то, чего не позволяет никакой другой объём. По этой базе считаются 50 отдельных признаков и четыре индекса для шести пород и помесей, и новые признаки появляются тогда, когда данных на них хватает, — а не тогда, когда их сочли важными.

Устройство базы стоит отдельного слова: она собирается не одним владельцем, а системой из более чем шестидесяти организаций — служб учёта, обрабатывающих центров, лабораторий генотипирования, породных ассоциаций, — и участие хозяйства добровольное. База создана Министерством сельского хозяйства США и передана CDCB в 2013 году.

Качество при этом обеспечивается не увещеванием, а сертификацией: и лаборатории, и «номинаторы» проходят проверку до того, как получают право писать в базу, и проходят ежегодный аудит после. Данные обезличиваются, третьим лицам без разрешения хозяйства не передаются и не продаются.

Из чего складывается «сотня миллионов»

Числа сведены к одной шкале — миллионам животных или записей. Видно, что масштаб держится не на генотипах: их тринадцать миллионов против ста миллионов животных с записями продуктивности. Считает такая база не потому, что у неё есть геномная оценка, а потому, что под ней полвека учёта.

Животных с записями100 млн
Генотипов13 млн
Коров в стадах DHI3,79 млн
Лактаций за год3,07 млн
CDCB, «National Cooperator Database»: статистика на июнь 2026

Что нужно для проверки

Чтобы иметь собственную базу признаков, нужны три вещи: референтная группа животных, по которой считаются среднее и генетическое стандартное отклонение, версия этой базы, хранимая вместе с каждой выпущенной оценкой, и объявленная дата пересчёта.

Чтобы масштаб вообще набрался, нужен приём данных не от одного вида отправителя. В американской системе хозяйство отдаёт данные службе учёта, служба — обрабатывающему центру, центр — в национальную базу, и на каждом переходе стоит сертификация. У книги отправителей теперь двое: хозяйство и тот, кому оно поручило присылать за себя. Сертификации на этих переходах нет — кто вправе быть службой учёта, книга не решает.

Чтобы добровольное участие работало, оно должно быть записано: согласие на передачу данных в сводную базу, его дата и объём. Иначе неизвестно, чьи записи можно считать, а чьи только показывать владельцу.

И чтобы масштабом можно было отвечать, его надо считать и публиковать: сколько животных, лактаций, стад, организаций и за сколько лет. Страница статистики базы — сама по себе часть системы: она отвечает на вопрос, который задают до того, как отдать данные.

Полей названо 7: есть 1, частично 3, нет 3. У каждого «частично» под описанием сказано, чего именно не хватает.

Что у нас есть сегодня

У книги есть то, чего у большой базы нет по определению, — обозримость. Каждая выпущенная оценка помечена версией базы, историей и признаком текущей, и путь от числа в документе до модуля, который его посчитал, проходится целиком.

Есть и приём с очередью, и сводка качества по всей книге: странные родители, даты в будущем, удой вне границ, инбридинг выше порога. Это то, что в американской системе делают обрабатывающие центры до попадания записи в базу.

Чего нет — своих чисел в основании. Признаков в базе индекса 12, и среднее, σ и наследуемость у всех взяты из чужой оценки. Это честно записано в коде и в версии базы, и это же — главный вывод страницы: мы пользуемся плодами чужого масштаба, не имея своего.

Счёта по живой книге здесь нет: витрина в базу не ходит, и число животных, лактаций и стад называется внутри книги, а не тут.

Кто может прислать данные в книгу

Масштаб набирается на переходах между организациями, а не на прилежании отдельного зоотехника. Дороги открыты все, кроме одной; чего на этой схеме нет вовсе — сертификации: кто вправе быть службой учёта, книга не решает и не проверяет.

ХозяйствофайлСвои животные, дойки, отёлы, осеменения — одиннадцатью наборами загрузки
ХозяйствообменСобытия по ICAR ADE от программы управления стадом
Служба учётапо поручениюКонтрольные дойки и события; в поручении перечислены виды загрузки · за хозяйство, которое её назначило
Лабораторияпо поручениюПоказатели молока и результаты генотипирования · за хозяйство
Доильный роботобменПосещения доения; суточный удой складывается книгой из них
Служба учётавыбор хозяйства в формеДействие загрузки умеет грузить за другое хозяйство, а форма — ещё нет
DATASETS в lib/import-format.ts, ADE_WRITABLE в lib/ade/parse.ts, коллекция submission-authorities

Чего не хватает

Собственной базы признаков. Пока среднее и σ берутся из американской оценки, наш индекс измеряет отклонение российского животного от американской базы — и делает это молча для всех, кто не открывал код.

Референтной группы, по которой такую базу можно было бы посчитать. Её надо не только выделить, но и назвать: годы рождения, породы, пороги полноты данных.

Сертификации отправителей. Присылать за хозяйство служба учёта теперь может — по его поручению, с записанным основанием, — но кто вправе быть такой службой, книга не решает и не проверяет. Масштаб набирается на этих переходах, и там же стоит сертификация, без которой он набирается мусором.

Записанного согласия хозяйства на участие в общей оценке — то есть того, на чём вся американская система и держится.

И числа, которое можно назвать вслух. Пока мы не публикуем, сколько у нас животных, лактаций и стад, разговор о масштабе ведётся только в одну сторону: их числа есть, наших нет. Соискателю здесь достаётся постановка, у которой нет чужой выборки, зато есть чужой образец устройства.

Чем наш ответ будет отличаться

Другая страна и другая система учёта: добровольный DHI с сертифицированными обрабатывающими центрами против нашего племенного учёта с государственной отчётностью. Из этого следует не «у них лучше», а то, что число стад у них — число согласившихся, а у нас — число обязанных.

Другой порядок величин, и признать это полезнее, чем сравнивать. 3,07 миллиона лактаций в год — это годовой прирост их базы, а не её объём.

Другая роль владельца базы. CDCB — независимый третий, который считает оценку и не торгует данными. Ассоциация в нашей рамке ближе к породной ассоциации из их системы, и это разные обязанности.

И другой источник чисел на этой странице. Всё, что здесь сказано о базе CDCB, сказано самой CDCB: это отчётность владельца, не проверенная третьей стороной, и никакого рецензирования за ней не стоит.

Чего пересчёт не докажет

Масштаб не доказывает правильности. Оценка на ста миллионах животных может быть смещённой систематически, и в самой публикации это видно: в апреле 2024 года иностранные группы неизвестных родителей пришлось объединить с внутренними именно потому, что рост числа генотипов из-за рубежа вносил смещение.

Число животных не равно числу наблюдений. Стомиллионное животное — это животное, связанное с записями продуктивности, накопленное за десятилетия, а не поголовье и не размер выборки в конкретной оценке.

И масштаб чужой базы ничего не говорит о том, какой должна быть наша. Копировать устройство системы из шестидесяти организаций там, где учёт устроен иначе, — отдельное решение Ассоциации, а не вывод из этой страницы.

Что завести в книге, чтобы вопрос стал проверяемым

Требований названо 5: полей 1, загрузок и обменов 0, расчётов 3, вне книги 1.

Слова этой страницы

Определения с нашими числами и с тем, чего каждое слово не означает.

Племенная ценностьОценка того, что животное передаёт потомству, выраженная отклонением от базовой популяции.
Индекс племенной ценностиОдно число, в которое свёрнуты оценки животного по одиннадцати признакам с весами выбранного профиля.
Генетическое стандартное отклонениеРазброс племенных ценностей по признаку; та мера, в которой считается индекс. У удоя 257,1 кг, у композита ног 0,53 балла.
Надёжность оценки, RДоля изменчивости прогноза, объяснённая собранными данными: насколько число сдвинется, когда данных станет больше.
Наследуемость, h²Доля различий между животными, объяснённая генами, а не кормлением и содержанием. У удоя 0,30, у фертильности 0,04.
База сравненияСреднее и генетическое σ по референтной группе — то, относительно чего племенная ценность считается отклонением.
Референтная популяцияГруппа животных с генотипом и надёжно измеренной продуктивностью, на которой устанавливается связь маркеров с признаком. Чужая работает тем хуже, чем дальше порода.
Геномная оценкаПрогноз племенной ценности по генотипу, перенесённый с референтной популяции: у молодого быка он есть до первой дочери.
NM$Американский индекс пожизненной прибыли, доллары; стандартное отклонение около 228 $. В книге есть приближение по общим признакам — шести признаков NM$ у нас нет.
Экономические весаРубли на единицу признака за продуктивную жизнь: чем считается индекс, когда его считают деньгами.
InterbullМеждународный центр, сводящий оценки быков примерно тридцати стран; он же ведёт трёхбуквенные коды пород, входящие в международный номер животного.
Уровень достоверности данныхКем подтверждена запись о животном: шкала от −1 до 3, от отклонённой экспертом до верифицированной Ассоциацией.

Читать дальше

Источники

Другие работы