Поиск предков по рукописным книгам: что делает ИИ и где он ошибается
Заметки по двум родословным: где лежат записи, почему их не найти поиском, какие приёмы работают с дореволюционными книгами, где ИИ ошибается и какие правила не дают ему дописать родословную за вас.
Из кейсаЗаписи есть, индекса нет
Большая часть церковных книг XIX века оцифрована, но искать по ним нельзя. Каталог доходит до дела: приход, годы, тип записей. Дальше — сотни сканов рукописи без текстового слоя, 300–500 сканов в книге и до 3 тыс. в томе. Поисковики по оцифрованным архивам с распознаванием текста есть, но по одной фамилии они выдают около 10 тыс. упоминаний, в основном шум: фамилия совпала с названием улицы, и адресные книги дали тысячи ложных попаданий.
Поэтому поиск идёт по географии: деревня → волость → уезд → приход → дело. Названия и границы с тех пор менялись, так что сначала восстанавливается старое административное деление. Однажды запрос ушёл не в тот архив как раз потому, что в нужные годы город относился к другому уезду.
Доступ стоит денег и терпения
- Одни архивы отдают сканы бесплатно и в полном разрешении.
- Другие — только после входа через госпортал.
- Третьи продают доступ посуточно: день стоит около 100 ₽, месяц — около 3 тыс. ₽. Поиск записи в неоцифрованном деле по заказу стоит уже тысячи рублей и занимает месяцы.
- Генеалогические платформы ограничивают просмотры: суточный лимит срабатывал то после 20, то после 90 страниц. После массового перебора платформа заблокировала адрес на сутки.
Поэтому порядок такой: сначала по бесплатному каталогу составляется список дел с номерами листов, потом покупается доступ на день под готовый список.
Приёмы, которые работают
- Сначала оглавление. У книги открывается титул и опись по годам, считается смещение «номер скана = лист + k», и дальше переход сразу к нужному году.
- Полосы. Из разворота вырезается одна колонка — «имена родившихся» или «родители», — и десятки разворотов просматриваются за минуты.
- Сплошной просмотр. Чтобы доказать, что других детей нет, нужно пройти все рождения прихода за 15 лет, а не найти одну запись.
- Возраст → год. Возраст при браке, в переписи или в исповедной росписи даёт год рождения ±1. В дереве такой год помечается «примерно».
- Крёстные и поручители. На венчании поручитель оказался дядей жениха, крёстный — родным братом отца. Запись «умершего такого-то сын» при крещении даёт верхнюю границу даты смерти.
- Имена. Второй сын, названный в честь умершего брата, выдаёт неизвестного первенца. По святцам восстанавливается месяц рождения, если он не читается. В записи бывает прямо сказано, что по-народному человека звали иначе, — отсюда расхождение отчеств в разных документах.
- Фамилии нет. В сельских метриках до 1880-х фамилию часто не пишут, и человека опознают по связке «деревня + отчество + супруг».
- Старый и новый стиль. Разница в 13 дней между метрикой и надгробием — не ошибка, а пересчёт стиля. Она стала одним из доказательств, что это один человек.
- Пометки на полях. «Выпись выдана» с датой — след того, что кто-то позже запрашивал документ. По такой пометке нашёлся человек, который оформлял бумаги спустя полвека.
- Косвенная датировка. Фото удалось датировать по теплоходу на заднем плане: год постройки и годы рейсов. Письмо — по содержанию.
Что ИИ делает хорошо
- Читает почерк, дореформенную орфографию и сокращения, отмечает сомнительные места.
- Не устаёт на сотом скане и выписывает все записи с фамилией, а не первую.
- Сводит документы между собой: перепись с венчанием 30-летней давности, крестины с ревизией.
- Ведёт журнал по каждому делу: какие листы смотрели, что нашли, что пусто.
- Пишет письма и сценарии звонков на других языках и собирает композиты для карточек дерева.
Где ИИ ошибается
- Уверенный тон. В первой сессии кандидат в прадеды был назван «почти наверняка», и на нём выросла цепочка поколений. Всё это пришлось откатывать.
- Однофамильцы. Совпадение фамилии и подходящее отчество — ещё не родство. В одной епархии нашлись десятки семей с той же фамилией.
- Условности источников. В адресной книге тире означает «та же фамилия, что выше». Из-за этого чужая семья на время стала своей.
- Распознанный текст. Распознавание искажало фамилию, склеивало соседние записи и давало два разных возраста одному человеку. Всё сверяется по скану.
- Легенды. Модель охотно подгоняет находки под версию, которую ей рассказали. Поиск долго шёл по семейной легенде о происхождении, а закрыла вопрос одна запись о крещении: сплошной просмотр книг занял один день.
Правила, которые держат дерево честным
- В дерево — только по документу или по прямым словам родственников, со ссылкой на дело и скан.
- Недоказанное начинается с пометки «не подтверждено». Рядом записано, что именно не подтверждено и какой документ это закроет. У звеньев без прямого документа стоит процент уверенности.
- Однофамильцы без доказанной связи — в заметки, не в дерево.
- Даты до 1918 года — по старому стилю, как в книге. Место — как оно называлось тогда.
- Сканы берутся в полном разрешении с сайта архива. Их не «улучшают»: качество от этого падает.
- Пустой результат тоже записывается, чтобы то же дело никто не открыл второй раз.
Как устроена работа
ИИ ищет, читает, сводит и вносит подтверждённое в дерево. Вход в архивы, оплата доступа и удаление данных — только с подтверждения владельца. Ответы родных не раз меняли картину, поэтому вопросы к семье собираются списком по ходу поиска.
Когда книги кончаются
Для XX века церковных книг нет. Записи старше ста лет передаются в госархив, более новые остаются в загсе, и справку из актовой записи можно заказать через госпортал. Для военных лет есть открытые базы наградных документов и потерь; отрицательный результат там тоже информативен. Живых родственников находят через совпадения на платформах, форумы, краеведческие группы и старые школьные фото. Могила с оплаченным на годы вперёд местом говорит о том, что живые родственники есть, а муниципалитет может переслать им письмо. Но всё найденное так проходит то же правило: без документа это гипотеза.