Неверный отец в записи: что он делает с оценками и как его увидеть у нас

Ошибка в отцовстве не просто портит одну запись — она делает быков похожими друг на друга сильнее, чем они есть, и сжимает разброс оценок. Работа считает это на настоящей родословной в 361 980 записей. У книги есть чем такую ошибку ловить: ДНК-тест с выводом и уровень доверия к записи; чего нет — счёта расхождений и их следствий.

Дмитрий Васин · 7 сентября 2026 г.

Работа

прочитана открытая часть

How pedigree errors affect genetic evaluations and validation statistics

Авторы
E. C. G. Pimentel, C. Edel, R. Emmerling, K.-U. Götz
Где и когда
Journal of Dairy Science, 2024
DOI
10.3168/jds.2023-24070
Лицензия
CC BY 4.0 — по записи Crossref и Europe PMC
Выборка
Настоящая родословная симментальского скота на 361 980 записей и настоящие генотипы 25 950 животных; племенные ценности и признаки смоделированы, наследуемость 0,25; четыре сценария — верная родословная и 5, 10 и 20 % неверных отцов
Что мы прочли
Прочитана открытая часть: название, аннотация, объём выборки

Страница написана по открытой части: всё, что здесь сказано о работе, проверяется по её названию, аннотации и объёму выборки. Ничего из закрытого текста тут нет — ни своими словами, ни через чужой пересказ.

Почему тогда работа взята. Раздел не пересказывает статью и не проверяет её расчёт — он переводит заданный в ней вопрос в перечень того, что книге нужно уметь хранить и считать. Для такого перевода нужна постановка вопроса и объём выборки, а они в открытой части и стоят: аннотация публикуется именно для того, чтобы по ней решали, о чём работа. Полный текст понадобился бы, чтобы повторить расчёт, — и в тот день, когда до расчёта дойдёт, он и будет нужен; до тех пор требовать его значило бы не заводить страницу вовсе.

Что при этом остаётся сказанным осторожно: выводы работы приводятся ровно в той мере, в какой их назвала сама аннотация, и всегда с оговоркой, что это аннотация. Наша половина страницы, начиная со второй части, от полноты чтения не зависит вовсе: она про нашу базу.

Аннотация у этой работы устроена как отчёт: в ней названы и выборка, и метод, и направление всех эффектов, и объяснение механизма. Чего в ней нет — величин: на сколько именно падает корреляция и разброс при каждой доле ошибок. Поэтому ниже мы говорим «падает» и «сильнее», а чисел эффекта не приводим ни одного: их в открытой части просто нет.

Зачем это книге

Верить ли тому, что написано о животном

Покупатель животного и надзор · При сделке, при выдаче свидетельства, при проверке хозяйства

Как решают сегодня
По бумаге с печатью. Кто внёс запись, когда и на каком основании, из бумаги не следует; расхождение с реестром обнаруживается уже после покупки.
Чего это стоит
Оценки литературы, на которые ссылается работа, — около десяти процентов ошибок в родословных молочного скота. Какова эта доля у нас, книга не считает: ДНК-тест с выводом «исключён» в карточку записывается, но сколько таких в базе и что из этого следует для оценок — неизвестно. Покупатель при этом платит именно за происхождение.
Что изменит работа
Доверие к записи перестаёт быть отметкой о происхождении бумаги и становится величиной с последствиями. Работа показывает, что неверный отец портит не одну карточку, а оценки всех быков сразу — и портит незаметно, потому что разброс сжимается плавно. Значит, доля подтверждённых происхождений — не отчётный показатель, а условие, при котором оценкам вообще можно верить.
Чем книга помогает уже
Уровень доверия к записи, подтверждение Ассоциацией, свидетельство с проверкой подлинности, выгрузка в ФГИАС, след пакета загрузки с отправителем и поручением

Решение выбрано из пяти, которые книга берётся обеспечивать (список — в шапке раздела). Работа, под которую не подходит ни одно из них, в раздел не берётся: без такого фильтра сюда годится любая статья, потребовавшая от нас данных, — а требует их любая.

Что утверждает работа

Работа спрашивает, что ошибки в родословной делают с оценками, посчитанными одношаговой моделью — то есть моделью, которая сводит вместе родство по документам и родство по геному. Прежние работы отвечали на этот вопрос для моделей без геномной части.

Метод: взяли настоящую родословную симментальского скота на 361 980 записей и настоящие генотипы 25 950 животных, подобранные так, чтобы родство по документам и по геному сходилось. На этой основе смоделировали истинные племенные ценности и признаки с наследуемостью 0,25, а потом считали оценки при верной родословной и при 5, 10 и 20 процентах неверных записей. Ошибку вносили так, как она случается: негенотипированной корове назначали случайного чужого отца.

Результат по аннотации: чем больше ошибок, тем ниже связь оценки с истинной племенной ценностью и тем меньше разброс оценок. Объяснение авторов важнее самого падения — ошибка в родословной работает как случайный обмен дочерьми между быками, и быки от этого выглядят похожими друг на друга сильнее, чем они есть. Проявляется это, разумеется, только у тех, у кого есть потомство: у проверенных по дочерям быков сжатие сильнее, чем у молодых кандидатов.

Отсюда следствие, ради которого работа и написана. При проверке модели прямым прогнозом — оценили молодых, дождались дочерей, сравнили — разброс у старших падает сильнее, и ранние оценки выглядят завышенными. То есть известная беда валидационных исследований, «инфляция ранних прогнозов», частично объясняется не моделью, а ошибками в родословных.

Сколько ошибок в родословной перебирали

Работа считала оценки на одной и той же настоящей родословной при четырёх долях подменённых отцов. Приглушённая полоса — верная родословная, точка отсчёта. Оценка литературы, на которую ссылаются авторы, — около десяти процентов ошибок в родословных молочного скота: это средняя полоса.

Верная родословная0 %
Пять процентов5 %
Десять процентов10 % — оценка по литературе
Двадцать процентов20 %
  • сценарии с ошибками
  • верная родословная — точка отсчёта
Сценарии работы: 5, 10 и 20 % неверных записей против верной родословной

Что нужно для проверки

Первое — родословная, которую есть с чем сверить. Ошибка обнаруживается только сравнением записанного отца с проверкой: либо ДНК-тестом, либо расхождением геномного родства с документальным. Одна лишь запись о происхождении непроверяема по определению: она не противоречит сама себе.

Второе — сама доля ошибок как величина. Работа перебирает 5, 10 и 20 процентов не для красоты: следствия у них разные по силе, и чтобы понять, в каком мы положении, надо знать свою долю. Считается она по животным, у которых есть и запись об отце, и независимая проверка.

Третье — связь ошибки с оценкой. Мало найти расхождение в карточке: нужно, чтобы оно доходило до расчёта — исключало животное из потомства быка или помечало оценку как посчитанную на непроверенном родстве. Иначе обнаруженная ошибка остаётся отметкой в карточке и на числа не влияет.

Полей названо 7: есть 2, частично 3, нет 2. У каждого «частично» под описанием сказано, чего именно не хватает.

Что у нас есть сегодня

Независимая проверка происхождения у книги есть, и она не сводится к бумаге: ДНК-тест хранится с выводом, лабораторией, способом подтверждения и номером сертификата, а панель ISAG — двенадцать локусов — лежит в карточке рядом. Это ровно тот материал, которым ошибка в родословной обнаруживается.

Уровень доверия к записи — отдельная величина, а не мнение. Он поднимается зарегистрированным протоколом лаборатории, падает при отзыве протокола и ставится вручную только на верхней ступени, экспертом. Свидетельство без верхней ступени не выдаётся.

Расхождение «отцовство исключено, а отец записан» книга умеет находить: такая проверка в списке есть. Дальше она ничего не делает, и об этом сказано ниже — но сам факт, что расхождение обнаруживается, отличает нас от системы, где родословная непроверяема в принципе.

Чего эта страница не знает — доли непроверенных и неподтверждённых записей в книге. Счёт по живой базе делается запросом внутри книги, а не здесь.

Чего не хватает

Счёта расхождений. Книга умеет найти запись, у которой ДНК-тест исключил записанного родителя, но не умеет сказать, сколько таких и какую долю от проверенных они составляют. Между тем это первое число, которое работа кладёт в основание: следствия у пяти и у двадцати процентов разные.

Следствия у найденного расхождения. Сегодня оно попадает в список проверок и там остаётся: уровень доверия не меняется, оценки пересчитываются как ни в чём не бывало. Хуже того, тест с выводом «исключено» ступень доверия не понижает — её поднимает сам факт наличия протокола, — и запись с опровергнутым отцом выглядит надёжнее непроверенной.

Собственной оценки ущерба. Работа считает, во что обходятся ошибки, моделированием на своей родословной; повторить это можно и у нас, но только после того, как появится своя доля ошибок и своя база сравнения. Пока ни того ни другого нет, переносить их выводы на наши числа нельзя — можно только принять механизм.

Второго способа находить ошибки — сверки документального родства с геномным. Он требует чиповых генотипов, а панель ISAG подтверждает пару «родитель — потомок» и на этом кончается.

Чем наш ответ будет отличаться

Другой материал: у работы племенные ценности и признаки смоделированы, настоящими были родословная и генотипы. У нас всё наоборот — признаки настоящие, а проверка происхождения есть не у всех. Наш ответ поэтому будет не о том, насколько падает точность, а о том, у скольких записей её вообще можно оценить.

Другая точка приложения. Работа адресована тем, кто считает оценки, и объясняет им странность в валидации. Нам она нужна раньше: до всякой валидации — чтобы решить, что делать с найденным расхождением, и чтобы объяснить покупателю, чем подтверждённое происхождение отличается от записанного.

Другая роль уровня доверия. У них родословная либо верна, либо нет, и это знание модельера. У нас это величина в карточке, которую видит покупатель, и потому неправда в ней дороже: она не портит расчёт, она вводит в заблуждение человека, который платит.

Чего пересчёт не докажет

Наш счёт расхождений не измерит долю ошибок в книге. Проверяют ДНК не случайных животных, а тех, кого продают, показывают и записывают в племенное ядро; доля ошибок среди проверенных заведомо не равна доле по всей базе, и назвать первую второй было бы именно той тихой неправдой, ради которой этот раздел ведётся.

Совпадение с числами работы ничего не докажет и не может: у них смоделированные ценности и своя популяция. Механизм — сжатие разброса оценок из-за случайного обмена дочерьми — переносится, величины нет.

Понижение доверия при исключённом отцовстве не сделает записи вернее. Оно сделает их честнее: покупатель увидит, что происхождение опровергнуто. Исправить запись может только тот, кто знает настоящего отца, а книга такого способа не имеет и иметь не может.

Что завести в книге, чтобы вопрос стал проверяемым

Требований названо 4: полей 1, загрузок и обменов 0, расчётов 3, вне книги 0.

Слова этой страницы

Определения с нашими числами и с тем, чего каждое слово не означает.

ПроисхождениеКто отец и кто мать — и чем это подтверждено. От родословной отличается тем, что это одно звено, и его можно проверить лабораторией.
РодословнаяДерево предков, построенное обходом связей «отец — мать». Хранится дважды — связью и текстом со свидетельства; в карточке показывается три ряда, вглубь считается до девяти колен.
Уровень достоверности данныхКем подтверждена запись о животном: шкала от −1 до 3, от отклонённой экспертом до верифицированной Ассоциацией.
Надёжность оценки, RДоля изменчивости прогноза, объяснённая собранными данными: насколько число сдвинется, когда данных станет больше.
Племенное свидетельствоДокумент для селекционной работы: три ряда предков с племенной ценностью каждого и лактациями. Собирается снимком на дату выдачи, и выданное не меняется.
Геномная оценкаПрогноз племенной ценности по генотипу, перенесённый с референтной популяции: у молодого быка он есть до первой дочери.

Читать дальше

Источники

Другие работы