(IA)(AI)Jak szukać lokalnie nazwisk w metrykach
-
poz_marecki
- Posty: 45
- Rejestracja: 24 lip 2020, 12:57
(IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Dzień dobry,kopia mojego postu /pytania z PTG gdzie umieściłem zapytanie z rozpędu,a to na tym forum temat był bardziej poruszany i liczę na odpowiedź..
Chciałbym przeskanować lokalnie na dedykowanym małym komputerze (i7,18 GB ram,Linux) na początek ponad 800 skanów z gminy Buk (Wlkp). Próbowałem przez Ollama/Kraken,potem Easyocr i Tesseract z modelami lat i script lat its.
Wszystko do bani.Mielił po parę godzin za każdym razem a efekty bardzo kiepskie, praktycznie żadne.Szukalem tylko konkretnego nazwiska i jego odmian wśród tekstu metryk.Potem planowałem oddzielną analizę wyników.
Niestety,IA jakie by nie było ma dużo czasu i testuje na mojej osobie metody które nie działają a potem proponuje inne które też nie działają.
Jeden z modeli zakodował sobie gdzieś w pamięci fałszywą informacje że córka zmarła to pierwsza żona mojego poszukiwanego i pomimo że sprawę sobie wytłumaczyliśmy to wróciła jak bumerang przy sortowaniu nazwisk na podstawie danych z Basia.famula.Chciał mnie zadowolić i dopasować do mojej teorii i tłumacząc metrykę z łaciny zmienił córka na żona a wiek z 7 lat na 40,haha.Oczywiście zauważyłem,ale z pewnością mogę nie zauważyć przy metrykach mniej istotnych.
Czy ktoś ma pomysł oparty na doświadczeniu czy pozostaje mi trenowanie modelu ręcznie?
Pozdrawiam
Marek
Chciałbym przeskanować lokalnie na dedykowanym małym komputerze (i7,18 GB ram,Linux) na początek ponad 800 skanów z gminy Buk (Wlkp). Próbowałem przez Ollama/Kraken,potem Easyocr i Tesseract z modelami lat i script lat its.
Wszystko do bani.Mielił po parę godzin za każdym razem a efekty bardzo kiepskie, praktycznie żadne.Szukalem tylko konkretnego nazwiska i jego odmian wśród tekstu metryk.Potem planowałem oddzielną analizę wyników.
Niestety,IA jakie by nie było ma dużo czasu i testuje na mojej osobie metody które nie działają a potem proponuje inne które też nie działają.
Jeden z modeli zakodował sobie gdzieś w pamięci fałszywą informacje że córka zmarła to pierwsza żona mojego poszukiwanego i pomimo że sprawę sobie wytłumaczyliśmy to wróciła jak bumerang przy sortowaniu nazwisk na podstawie danych z Basia.famula.Chciał mnie zadowolić i dopasować do mojej teorii i tłumacząc metrykę z łaciny zmienił córka na żona a wiek z 7 lat na 40,haha.Oczywiście zauważyłem,ale z pewnością mogę nie zauważyć przy metrykach mniej istotnych.
Czy ktoś ma pomysł oparty na doświadczeniu czy pozostaje mi trenowanie modelu ręcznie?
Pozdrawiam
Marek
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Nawet najgłupszy program AI musi być oparty o wiedze zweryfikowaną . Czyli o indeksy z poprawionymi danymi . Te metryki pisali normalni ludzie i też się mylili a pomyłki nieraz są oczywiste jak wiek 450 lat .
Jeżeli taki wiek wpiszesz i podasz programowi AI przyjmie on tą daną jak każda inną i ta wiedza będzie podstawą odpowiedzi .
Więc przed korzystaniem z programów AI trzeba wykonac indeksację i to w oparciu o specyficzne atrybuty albo jak mówią ci od baz danych specjalne pola .
Żadna baza indeksów do tego się nie nadaje gdyż brak podstawowego atrybutu –dokładnej daty zdarzenia a i wielu innych .
CO do treningu a właściwie uczenia .
Znamy tylko jeden sposób treningu:
Nauka z nauczycielem
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 5
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 2
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 5
…………………………………
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena
2
Innych metod nie ma .
A jaki ty jesteś nauczyciel ? Skąd ma AI wiedzieć co jest regułą a co wyjątkiem
My od 10 lat używamy program AI do wyszukiwania przodków jako dostaliśmy od kolegów genealogów z USA .
Świetny program ale podstawą jest baza wiedzy w postaci indeksu i to bez błędów . Jezli jakaś dana jest wątpliwa trzeba ocennie ja ocenić .
Program działa świetnie ale niestety jest niedostępny w Polsce .
PS
Dobrze ,że napisałeś tutaj gdyż Forum genealodzy.pl too Forum zamknięte i niedostępne dla nie uzerów.a 80- % genealogów nie jest userami tego portalu
Ryszard Welka
Toruń
Jeżeli taki wiek wpiszesz i podasz programowi AI przyjmie on tą daną jak każda inną i ta wiedza będzie podstawą odpowiedzi .
Więc przed korzystaniem z programów AI trzeba wykonac indeksację i to w oparciu o specyficzne atrybuty albo jak mówią ci od baz danych specjalne pola .
Żadna baza indeksów do tego się nie nadaje gdyż brak podstawowego atrybutu –dokładnej daty zdarzenia a i wielu innych .
CO do treningu a właściwie uczenia .
Znamy tylko jeden sposób treningu:
Nauka z nauczycielem
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 5
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 2
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena 5
…………………………………
Takie zdarzenie,takie zdarzenie ,taki efekt , ………………………………ocena
2
Innych metod nie ma .
A jaki ty jesteś nauczyciel ? Skąd ma AI wiedzieć co jest regułą a co wyjątkiem
My od 10 lat używamy program AI do wyszukiwania przodków jako dostaliśmy od kolegów genealogów z USA .
Świetny program ale podstawą jest baza wiedzy w postaci indeksu i to bez błędów . Jezli jakaś dana jest wątpliwa trzeba ocennie ja ocenić .
Program działa świetnie ale niestety jest niedostępny w Polsce .
PS
Dobrze ,że napisałeś tutaj gdyż Forum genealodzy.pl too Forum zamknięte i niedostępne dla nie uzerów.a 80- % genealogów nie jest userami tego portalu
Ryszard Welka
Toruń
-
Maciej Wojtkowiak
- Posty: 93
- Rejestracja: 10 kwie 2026, 20:42
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Na początek spróbuj znaleźć indeksy robione przez amerykańskich wolontariuszy z FamilySearch.
Poindeksowali lata 1686 do 1920 (można szukac w poszczególnych sekcjach za pomocą lupy) - zwróć uwagę, że te sekcje z indeksami są rozrzucone na 3 stronach:
http://familysearch.org/pl/search/catalog/94244
Jakoś tych indeksów jest dość kiepska, nie ma świadków, zawodów, statusów społecznych oraz nazw podbukowskich wsi, których dany indeks dotycz itp. Nazwiska mogą być niemiłosiernie poprzekręcane bo indeksujący nie znali polskiego i naszych nazwisk. Ale na start lepszy rydz niż nic.
Mają oni tam dość rozbudowane kryteria wyszukiwania i możesz np. podać tylko imię ojca i matki (bez nazwiska) i zwróci odpowiednie rekordy z danej sekcji. Możesz używać również wildcards np. wyszukując Jan Kow*
To dobry punkt na start - może uda Ci się znaleźć jakiś indeks i już go potem zweryfikować na skanie.
Ja często z tego korzystam i wiele dzięki temu znalazłem.
Co do Twojego pytania - to robiłem to z modelami Gemini do transkrypcji różnych akt z Przemętu, ewangelickiego Śmigla z 18 wieku czy Góry pod Wrocławiem i Barczewa na Warmii. Bezpłatne modele Gemini bezczelnie halucynowały w podobny sposób jak to opisywałeś. Płatne już radziły sobie lepiej i oceniam jakość tych indeksów na lepsze niż FamilySearch ale gorsze niż robione przez polskich wolontariuszy (no jasne!
) Gemini 3.1 PRO lub 3.5 lub 3.6 Flash. Ale aby tego używać trzeba albo wykupić pakiet AI od Google (około stówki na miesiąc) i wówczas można korzystać z czatu gemini i wrzucać po parę plików i promptować o wyniki. Można też wykupić klucz płatny do gemini i albo w skrypcie Pythona (mój skrypt wygenerował Gemini jak opisałem co chcę robić) albo w Google AI studio promptować skan po skanie. Niestety to już droższa zabawa. Na starcie dostajesz chyba pareset złotych darmowych do wypalenia i można sobie trochę podziałać ale jak już to wypalisz to potem koszty potrafią się szybko kumulować i trzeba dobrze oszacować czy coś takiego się opłaca.
Jest jedna metoda - obniżenia kosztów - wrzucenie wszystkich skanów do dedykowanej chmury w google i odpalanie tego w trybie asynchronicznym - ja tego nie próbowałem ale podobno koszty wtedy się redukują o ok 50% tylko trzeba z dobę poczekać na rezultaty. Nie stosowałem tego ponieważ na bieżąco po jakichś partiach skanów poprawiałem mojego prompta do transkrypcji a w przypadku takiego masowego przetwarzania nie jest to możliwe.
Jest jeszcze inna opcja, której nigdy nie próbowałem - użycie kombajna Transkribusa i zastosowanie gotowych modeli lub nauczenie go od podstaw pism bukowskich księży.
Co do innych topowych modeli jak Chat GPT czy Claude to używam ich codziennie w pracy ale to do zupełnie innych rzeczy i nie wiem jak radzą sobie z transkrypcją łacińskiej czy niemieckiej kursywy.
Pozdrawiam
Maciej Wojtowiak
Poindeksowali lata 1686 do 1920 (można szukac w poszczególnych sekcjach za pomocą lupy) - zwróć uwagę, że te sekcje z indeksami są rozrzucone na 3 stronach:
http://familysearch.org/pl/search/catalog/94244
Jakoś tych indeksów jest dość kiepska, nie ma świadków, zawodów, statusów społecznych oraz nazw podbukowskich wsi, których dany indeks dotycz itp. Nazwiska mogą być niemiłosiernie poprzekręcane bo indeksujący nie znali polskiego i naszych nazwisk. Ale na start lepszy rydz niż nic.
Mają oni tam dość rozbudowane kryteria wyszukiwania i możesz np. podać tylko imię ojca i matki (bez nazwiska) i zwróci odpowiednie rekordy z danej sekcji. Możesz używać również wildcards np. wyszukując Jan Kow*
To dobry punkt na start - może uda Ci się znaleźć jakiś indeks i już go potem zweryfikować na skanie.
Ja często z tego korzystam i wiele dzięki temu znalazłem.
Co do Twojego pytania - to robiłem to z modelami Gemini do transkrypcji różnych akt z Przemętu, ewangelickiego Śmigla z 18 wieku czy Góry pod Wrocławiem i Barczewa na Warmii. Bezpłatne modele Gemini bezczelnie halucynowały w podobny sposób jak to opisywałeś. Płatne już radziły sobie lepiej i oceniam jakość tych indeksów na lepsze niż FamilySearch ale gorsze niż robione przez polskich wolontariuszy (no jasne!
Jest jedna metoda - obniżenia kosztów - wrzucenie wszystkich skanów do dedykowanej chmury w google i odpalanie tego w trybie asynchronicznym - ja tego nie próbowałem ale podobno koszty wtedy się redukują o ok 50% tylko trzeba z dobę poczekać na rezultaty. Nie stosowałem tego ponieważ na bieżąco po jakichś partiach skanów poprawiałem mojego prompta do transkrypcji a w przypadku takiego masowego przetwarzania nie jest to możliwe.
Jest jeszcze inna opcja, której nigdy nie próbowałem - użycie kombajna Transkribusa i zastosowanie gotowych modeli lub nauczenie go od podstaw pism bukowskich księży.
Co do innych topowych modeli jak Chat GPT czy Claude to używam ich codziennie w pracy ale to do zupełnie innych rzeczy i nie wiem jak radzą sobie z transkrypcją łacińskiej czy niemieckiej kursywy.
Pozdrawiam
Maciej Wojtowiak
Ostatnio zmieniony 12 sie 2026, 11:20 przez Maciej Wojtkowiak, łącznie zmieniany 1 raz.
-
Maciej Wojtkowiak
- Posty: 93
- Rejestracja: 10 kwie 2026, 20:42
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
I jeszcze par. ewangelicka Buk
1. Księgi metrykalne: https://www.familysearch.org/pl/search/ ... oha:102190
2. Duplikat : https://www.familysearch.org/pl/search/ ... koha:68816
3. USC: https://www.familysearch.org/pl/search/ ... oha:379742
ale w USC zindeksowali tylko lata 1874-1877
1. Księgi metrykalne: https://www.familysearch.org/pl/search/ ... oha:102190
2. Duplikat : https://www.familysearch.org/pl/search/ ... koha:68816
3. USC: https://www.familysearch.org/pl/search/ ... oha:379742
ale w USC zindeksowali tylko lata 1874-1877
-
poz_marecki
- Posty: 45
- Rejestracja: 24 lip 2020, 12:57
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Dziękuję za udział w dyskusji i próbę pomocy .
Jeżeli chodzi o family search to ich indeksację komputerową aktow z Buku,Otorowa i okolic oglądałem setki razy w internecie,w przypadku gdy chciałem sprawdzić niedostępny nigdzie to musiałem się pofatygować osobiście -na szczęście warto było bo trafiłem na bardzo ważny akt .
Mam prawie cały Buk na dysku także mogę większość aktów oglądać bez internetu.
Wyszukiwarka Mormonów jest powiedzmy grzecznie niedopracowana .Jak to napisał kolega Ryszard kiedyś,cuda z nazwiskami.Trzeba naprawdę mieć samozaparcie żeby znaleźć niektóre nazwiska tak przeinaczone przez IA że lepiej nie można.Z Zentkeller na Leuktelel dla przykładu.
Niestety,indeksacja na Basi też nie do końca jest dokładna.(ślub dwóch mężczyzn w latach 1700 czy też "ojciec urodzony w Rosji"-defacto Borussia -Prusy,takie kwiatki pierwsze z brzegu tylko z mojego zakresu poszukiwań)
Stąd pomysł żeby przepuścić to wszystko lokalnie szukając tylko jednego nazwiska i jego odmian a potem sobie obejrzeć akt po akcie lub przez Gemini i podobne.Mam potem w planie metryki z Litwy, gdzie nie są dostępne indeksy.Jeżeli metoda się sprawdzi na Buku , gdzie większość mamy zrobioną i można ręcznie sprawdzać to można będzie zastosować na metrykach nieznanych z Litwy.
Oczywiście mogę opłacić abonament,nie ma problemu, wybór jest duży,nie jest to problemem.
Moim celem jest po prostu model autonomiczny bez dostępu do internetu i automatyzacja procesu.Jak pisałem wyszukiwanie za każdym razem jednego nazwiska i jego odmian.
Zobaczę na forach zagranicznych czy ktoś już to rozwiązał.
Pozdrawiam
Marek
Jeżeli chodzi o family search to ich indeksację komputerową aktow z Buku,Otorowa i okolic oglądałem setki razy w internecie,w przypadku gdy chciałem sprawdzić niedostępny nigdzie to musiałem się pofatygować osobiście -na szczęście warto było bo trafiłem na bardzo ważny akt .
Mam prawie cały Buk na dysku także mogę większość aktów oglądać bez internetu.
Wyszukiwarka Mormonów jest powiedzmy grzecznie niedopracowana .Jak to napisał kolega Ryszard kiedyś,cuda z nazwiskami.Trzeba naprawdę mieć samozaparcie żeby znaleźć niektóre nazwiska tak przeinaczone przez IA że lepiej nie można.Z Zentkeller na Leuktelel dla przykładu.
Niestety,indeksacja na Basi też nie do końca jest dokładna.(ślub dwóch mężczyzn w latach 1700 czy też "ojciec urodzony w Rosji"-defacto Borussia -Prusy,takie kwiatki pierwsze z brzegu tylko z mojego zakresu poszukiwań)
Stąd pomysł żeby przepuścić to wszystko lokalnie szukając tylko jednego nazwiska i jego odmian a potem sobie obejrzeć akt po akcie lub przez Gemini i podobne.Mam potem w planie metryki z Litwy, gdzie nie są dostępne indeksy.Jeżeli metoda się sprawdzi na Buku , gdzie większość mamy zrobioną i można ręcznie sprawdzać to można będzie zastosować na metrykach nieznanych z Litwy.
Oczywiście mogę opłacić abonament,nie ma problemu, wybór jest duży,nie jest to problemem.
Moim celem jest po prostu model autonomiczny bez dostępu do internetu i automatyzacja procesu.Jak pisałem wyszukiwanie za każdym razem jednego nazwiska i jego odmian.
Zobaczę na forach zagranicznych czy ktoś już to rozwiązał.
Pozdrawiam
Marek
-
Maciej Wojtkowiak
- Posty: 93
- Rejestracja: 10 kwie 2026, 20:42
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
No jasne - nie skupiłem się na lokalnym przetwarzaniu. Jako, że nie miałem z nim do czynienia zapytałem Gemini i wklejam co mi napisało (może choć trochę pomoże nakierunkować poszukiwania):
Lokalne modele AI do transkrypcji metryk (Kurrenta i łacina)
Pogłębiony research wskazuje, że do masowego przetwarzania aktów metrykalnych całkowicie offline (gdzie precyzja zapisu nazwisk, miejsc i zawodów jest kluczowa i nie ma miejsca na tzw. halucynacje), najlepiej sprawdzają się dwa równoległe podejścia. Oto zaktualizowane, techniczne zestawienie autonomicznych rozwiązań:
1. Wyspecjalizowane frameworki HTR (Handwritten Text Recognition)
Te narzędzia nie "zgadują" kontekstu tak agresywnie jak modele językowe, co jest ogromną zaletą przy odczytywaniu unikalnych staropolskich lub niemieckich nazwisk zapisanych w XIX-wiecznych księgach.
Rozwiązania idealne do szybkiego, lokalnego testowania, wyciągania metadanych i pracy z pojedynczymi, zniszczonymi aktami małżeństw czy zgonów.
Zamiast wrzucać do modelu VLM całą stronę skanu księgi (co często kończy się zgubieniem wierszy lub konfabulowaniem nazwisk), w środowisku domowym najlepiej sprawdza się podejście hybrydowe:
1. Zastosowanie własnego skryptu w Pythonie (np. z wykorzystaniem biblioteki OpenCV) do automatycznego rozpoznawania tabel i wstępnego wycięcia poszczególnych rubryk lub wierszy z aktu.
2. Przekazanie wyciętych fragmentów z samym nazwiskiem lub datą do wyspecjalizowanego modelu, takiego jak TrOCR (wagi dla kurrenty) lub Florence-2.
3. Automatyczny zapis wyników prosto do ustrukturyzowanych ramek danych (np. przez Pandas do CSV), co daje czystą bazę gotową do dalszego, masowego indeksowania.
Lokalne modele AI do transkrypcji metryk (Kurrenta i łacina)
Pogłębiony research wskazuje, że do masowego przetwarzania aktów metrykalnych całkowicie offline (gdzie precyzja zapisu nazwisk, miejsc i zawodów jest kluczowa i nie ma miejsca na tzw. halucynacje), najlepiej sprawdzają się dwa równoległe podejścia. Oto zaktualizowane, techniczne zestawienie autonomicznych rozwiązań:
1. Wyspecjalizowane frameworki HTR (Handwritten Text Recognition)
Te narzędzia nie "zgadują" kontekstu tak agresywnie jak modele językowe, co jest ogromną zaletą przy odczytywaniu unikalnych staropolskich lub niemieckich nazwisk zapisanych w XIX-wiecznych księgach.
- Pero OCR - Projekt rozwijany przez Politechnikę w Brnie. Choć znany z interfejsu webowego, sam silnik jest open-source i działa lokalnie. Posiada jedne z najlepszych na rynku, wytrenowanych modeli do łacińskiej i niemieckiej kursywy (w tym Kurrenty i Sütterlin). Znakomicie radzi sobie z tabelarycznym układem starych ksiąg i marginesami.
- Loghi - Nowoczesny framework od holenderskiego KNAW Humanities Cluster. Działa w oparciu o kontenery Docker. Łączy zaawansowaną analizę układu strony (tzw. Layout Analysis) z niezawodnym silnikiem PyLaia. To obecnie jeden z najpotężniejszych darmowych kombajnów do masowego przetwarzania historycznych archiwaliów.
- Kraken - Standard akademicki (często stosowany w projektach e-scripta). Wymaga odpowiedniego przygotowania obrazu, ale repozytoria (np. Zenodo) są pełne gotowych, bardzo precyzyjnych modeli dla Kurrenty.
Rozwiązania idealne do szybkiego, lokalnego testowania, wyciągania metadanych i pracy z pojedynczymi, zniszczonymi aktami małżeństw czy zgonów.
- Florence-2 (od Microsoft) - Niezwykle lekki model (łatwy do uruchomienia na domowej karcie graficznej), który wykazuje fenomenalne zdolności OCR i rozpoznawania układu przestrzennego dokumentu. Bardzo łatwo zintegrować go z własnymi skryptami.
- Llama 3.2 Vision (11B) - Najnowsza generacja lokalnych modeli od Meta. Potrafi nie tylko odczytać łacińską czy niemiecką kursywę, ale od razu wyodrębnić z niej kluczowe informacje (imię, data, parafia) i sformatować je np. do struktury JSON.
- Qwen2-VL / InternVL 2.0 - Liderzy w czytaniu "brudnego", gęstego tekstu. Warto szukać na Hugging Face wersji modeli po tzw. fine-tuningu, optymalizowanych stricte pod OCR archiwaliów.
Zamiast wrzucać do modelu VLM całą stronę skanu księgi (co często kończy się zgubieniem wierszy lub konfabulowaniem nazwisk), w środowisku domowym najlepiej sprawdza się podejście hybrydowe:
1. Zastosowanie własnego skryptu w Pythonie (np. z wykorzystaniem biblioteki OpenCV) do automatycznego rozpoznawania tabel i wstępnego wycięcia poszczególnych rubryk lub wierszy z aktu.
2. Przekazanie wyciętych fragmentów z samym nazwiskiem lub datą do wyspecjalizowanego modelu, takiego jak TrOCR (wagi dla kurrenty) lub Florence-2.
3. Automatyczny zapis wyników prosto do ustrukturyzowanych ramek danych (np. przez Pandas do CSV), co daje czystą bazę gotową do dalszego, masowego indeksowania.
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Opiszę, jak ja to robiłem.
Miałem do przejrzenia około 10 ksiąg metrykalnych z określonej miejscowości w poszukiwaniu jednego konkretnego nazwiska. Chciałem wiedzieć, czy na przełomie XVII i XVIII wieku występowało ono na tym terenie. Po ręcznym przejrzeniu 5 ksiąg natrafiłem na 3 wpisy z szukanym nazwiskiem.
Następnie postanowiłem sprawdzić, jaki efekt da wykorzystanie AI. Zakupiłem na znanym portalu aukcyjnym miesięczny dostęp do Gemini 3.1 Pro (koszt: kilkanaście złotych). Napisałem poniższy prompt:
Rola: Działaj jako ekspert w dziedzinie paleografii staropolskiej (neografia polska i łacińska XVII–XVIII w.) i genealogii. Twoim celem jest bezbłędna ekstrakcja nazwiska XXXX i jego wariantów z załączonych dokumentów. Są to księgi urodzeń, małżeństw i zgonów Kościoła katolickiego.
Metodologia pracy (ścisłe wytyczne):
Analiza linia po linii: Nie skanuj obrazu całościowo. Analizuj tekst fragmentami, odczytując każdą linijkę, aby wyłapać nazwisko ukryte w skrótach lub trudnych ligaturach.
Słownik wariantów: Szukaj form: (tutaj podałem nazwisko oraz jego odmiany).
Instrukcja raportowania: Dla każdej partii przesłanych 10 plików przygotuj raport według schematu:
Numer pliku: [--------ODNALEZIONO--------] / [NIE ODNALEZIONO].
Po dokonaniu analizy każdej partii 10 dokumentów wyczyść pamięć.
Ważne: Jeśli pismo w danym fragmencie jest skrajnie nieczytelne, zaznacz to, zamiast go pomijać lub zgadywać. Nie spiesz się – liczy się 100% trafność, rzetelność oraz dokładność analizy, a nie szybkość działania.
Następnie wrzucałem ręcznie paczkami po 10 skanów z przejrzanych przeze mnie 5 ksiąg. Gemini Pro znalazł dokładnie 3 trafienia – w tych samych miejscach, co ja. W pozostałych 5 księgach nie znalazł niczego. Pytanie, czy był skuteczny – nie wiem.
Do odczytania wszystkich nazwisk z danej karty raczej się jeszcze nie nadaje. Ze znalezieniem jednego konkretnego, według mnie, radzi sobie bardzo dobrze.
Moja metoda wydaje mi się tania i skuteczna – wymaga jednak poświęcenia czasu na wrzucanie plików po 10 sztuk.
Pozdrawiam:
Marcin
Miałem do przejrzenia około 10 ksiąg metrykalnych z określonej miejscowości w poszukiwaniu jednego konkretnego nazwiska. Chciałem wiedzieć, czy na przełomie XVII i XVIII wieku występowało ono na tym terenie. Po ręcznym przejrzeniu 5 ksiąg natrafiłem na 3 wpisy z szukanym nazwiskiem.
Następnie postanowiłem sprawdzić, jaki efekt da wykorzystanie AI. Zakupiłem na znanym portalu aukcyjnym miesięczny dostęp do Gemini 3.1 Pro (koszt: kilkanaście złotych). Napisałem poniższy prompt:
Rola: Działaj jako ekspert w dziedzinie paleografii staropolskiej (neografia polska i łacińska XVII–XVIII w.) i genealogii. Twoim celem jest bezbłędna ekstrakcja nazwiska XXXX i jego wariantów z załączonych dokumentów. Są to księgi urodzeń, małżeństw i zgonów Kościoła katolickiego.
Metodologia pracy (ścisłe wytyczne):
Analiza linia po linii: Nie skanuj obrazu całościowo. Analizuj tekst fragmentami, odczytując każdą linijkę, aby wyłapać nazwisko ukryte w skrótach lub trudnych ligaturach.
Słownik wariantów: Szukaj form: (tutaj podałem nazwisko oraz jego odmiany).
Instrukcja raportowania: Dla każdej partii przesłanych 10 plików przygotuj raport według schematu:
Numer pliku: [--------ODNALEZIONO--------] / [NIE ODNALEZIONO].
Po dokonaniu analizy każdej partii 10 dokumentów wyczyść pamięć.
Ważne: Jeśli pismo w danym fragmencie jest skrajnie nieczytelne, zaznacz to, zamiast go pomijać lub zgadywać. Nie spiesz się – liczy się 100% trafność, rzetelność oraz dokładność analizy, a nie szybkość działania.
Następnie wrzucałem ręcznie paczkami po 10 skanów z przejrzanych przeze mnie 5 ksiąg. Gemini Pro znalazł dokładnie 3 trafienia – w tych samych miejscach, co ja. W pozostałych 5 księgach nie znalazł niczego. Pytanie, czy był skuteczny – nie wiem.
Do odczytania wszystkich nazwisk z danej karty raczej się jeszcze nie nadaje. Ze znalezieniem jednego konkretnego, według mnie, radzi sobie bardzo dobrze.
Moja metoda wydaje mi się tania i skuteczna – wymaga jednak poświęcenia czasu na wrzucanie plików po 10 sztuk.
Pozdrawiam:
Marcin
-
poz_marecki
- Posty: 45
- Rejestracja: 24 lip 2020, 12:57
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Bardzo interesujące doświadczenia.Kraken,llama,qwen u mnie poległy, zresztą jestem w trakcie konfiguracji do innych zadań,nie tylko genealogia..
Chciałem zrobić ewentualnie jak kolega Marcin, jeżeli już stracę cierpliwość,do całego procesu poszukiwań w tym wypadku dodałbym agenta IA operującego na API Gemini, żeby tego nie klepać ręcznie.
Na dzień dzisiejszy widzę dwa wyjścia lokalne :
trenowanie/dostrajanie modelu krakena
lub : nic nie robić i czekać na gotowca za parę tygodni, miesięcy,
do lekkiej adaptacji .Oprócz genealogii mam jeszcze parę innych hobby oraz pracę a życie jest krótkie..
Pozdrawiam
Marek
Chciałem zrobić ewentualnie jak kolega Marcin, jeżeli już stracę cierpliwość,do całego procesu poszukiwań w tym wypadku dodałbym agenta IA operującego na API Gemini, żeby tego nie klepać ręcznie.
Na dzień dzisiejszy widzę dwa wyjścia lokalne :
trenowanie/dostrajanie modelu krakena
lub : nic nie robić i czekać na gotowca za parę tygodni, miesięcy,
do lekkiej adaptacji .Oprócz genealogii mam jeszcze parę innych hobby oraz pracę a życie jest krótkie..
Pozdrawiam
Marek
-
Maciej Wojtkowiak
- Posty: 93
- Rejestracja: 10 kwie 2026, 20:42
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Marcinie. To dość żmudne wrzucać do Gemini po 5 aktów - wiem bo sam to przez miesiąc robiłem
Pamiętam, że mimo nakazu czyszczenia kontekstu to tak czy siak po kilkudziesięciu skanach zaczynałem w nowym wątku bo się gubił.
Potem kazałem napisać skrypt w Pythonie i szło już przez API.
Ja z par. Przemęt zczytywałem całe księgi. Oto przykładowy prompt sprzed paru miesięcy który znalazłem w historii gdy jeszcze zapisywalem dane do tabel a nie do formatu JSON z którym LLM dobrze się dogaduje:
SYSTEM INSTRUCTIONS: EXPERT PALEOGRAPHER (PRZEMĘT PARISH) - DUAL PHASE PROCESSING
Jesteś wybitnym ekspertem paleografii i genealogii XVIII-wiecznej Wielkopolski (specjalizacja: parafia Przemęt). Twoim zadaniem jest transkrypcja i indeksacja aktów małżeństwa.
WAŻNE: Twoja praca składa się z dwóch ODDZIELNYCH etapów. Nie wolno Ci generować tabeli, dopóki nie wykonasz pełnej transkrypcji surowej (Etap 1).
---
### ETAP 1: TRANSKRYPCJA I ANALIZA (OBLIGATORYJNY)
Zanim stworzysz tabelę, musisz wygenerować sekcję o nazwie **"ANALIZA PALEOGRAFICZNA"**. W tej sekcji dla każdego wpisu na skanie:
1. **Zidentyfikuj blok tekstu:** Określ fizyczne położenie (np. "Wpis 1, lewa kolumna, góra").
2. **Surowy OCR (Transkrypcja dyplomatyczna):** Przepisz tekst słowo w słowo po łacinie, zachowując oryginalne łamanie linii, skróty i błędy pisarza. Nie poprawiaj tu niczego. To ma być wierne odwzorowanie tego, co widzisz.
3. **Zastosowanie filtrów:** Pod surowym tekstem napisz notatkę, np.: "Widzę końcówkę 'Ey-', w nowej linii 'chlerski' -> Scalam do Eychlerski", "Widzę 'Gierley' -> Koryguję na Fierley zgodnie z zasadą G/F".
Dopiero po zakończeniu analizy wszystkich wpisów na stronie przejdź do Etapu 2.
---
### ETAP 2: GENEROWANIE TABELI (FINALNY PRODUKT)
Na podstawie analizy z Etapu 1, wygeneruj tabelę stosując poniższe rygorystyczne zasady interpretacji.
TRYB PRACY: "INTELIGENTNY DEKODER"
ZERO KREATYWNOŚCI FABULARNEJ. MAKSIMUM WIEDZY PALEOGRAFICZNEJ.
1. SŁOWNIK KOREKCYJNY I FILTRY (PRIORYTET ABSOLUTNY)
Te zasady stosujesz podczas przenoszenia danych z Etapu 1 do tabeli.
ZASADA ANTY-HALUCYNACYJNA (RESET KONTEKSTU)
Każdy wpis jest nową zagadką. ZABRANIA SIĘ kopiowania nazwisk urzędników (organista, sołtys) z poprzednich wpisów, jeśli nie jesteś w 100% pewien liter.
Jeśli widzisz 'Organarius' i nazwisko na 'S', nie wpisuj automatycznie 'Jockel'. Sprawdź, czy to nie 'Saetecki'.
Jeśli widzisz nazwisko na 'Zy...', nie zmieniaj na 'Szymanowski'. Istnieje nazwisko 'Zykmanowski'.
A. ZASADA "G vs F" (Kluczowa dla nazwiska Fierley): W tym kroju pisma wielkie "F" ma pętlę, która mylnie wygląda jak "G".
- WIDZISZ: Gierlay, Gierley, Gierli, Gierl -> WPISUJESZ: Fierley (lub Fierli).
- WIDZISZ: Grydrych -> WPISUJESZ: Frydrych.
B. ZASADA "t vs ł" (Kluczowa dla końcówek): Pisarz przekreśla "ł" w sposób identyczny jak "t".
- WIDZISZ: Pigtosz, Pigtos -> WPISUJESZ: Pigłosz.
- WIDZISZ: Maty -> WPISUJESZ: Mały.
- WIDZISZ: Makata -> WPISUJESZ: Makała.
- WIDZISZ: Napierata -> WPISUJESZ: Napierała.
- WIDZISZ: Chalinik -> WPISUJESZ: Chałupnik.
- WIDZISZ: Kmyto -> WPISUJESZ: Kmieć (traktuj jako status).
C. SPECYFICZNE KOREKTY NAZWISK:
- WIDZISZ: Niestrecke, Niestracke -> WPISUJESZ: Niestrawski (lub Niestracki – sprawdź końcówkę).
- WIDZISZ: Postrzedny, Postrzodny -> WPISUJESZ: Postrzedny (Nie Pasterny!).
D. ZAKAZANE NAZWISKA (To są statusy!): Jeśli słowo występuje w miejscu nazwiska, ale jest na tej liście, przenieś je do kolumny "Status":
Lista: Kmyto, Cmeto, Cmetho, Molitor, Molitorem, Opilio, Opilionem, Figulus, Arcularius, Faber, Fabrum, Caupo, Braxator, Braxatorem, Inquilinus, Inquilinum, Hortulanus, Aulicus, Villicus, Scultetus, Sartor, Sartorem, Sutor, Sutorem, Auriga, Aurigam.
Liber / Liberum (oznacza status 'wolny', wpisz do kolumny Status).
Agidii / Aegidii (to imię Idzi/Egidiusz w dopełniaczu – wpisz do kolumny Imię, nazwisko zostaw puste).
Adolescens / Adolescentem (tłumacz jako 'młodzian', nigdy nie zostawiaj samego łacińskiego słowa)."
E. ZASADA "OJCIEC PANNY": Jeśli widzisz frazę: "Filiam [Imię] [Nazwisko]" (np. Filiam Melchioris Borowy), to:
- [Imię] (Melchior) -> Kolumna "Panna Ojciec Imię".
- [Nazwisko] (Borowy) -> Kolumna "Panna Ojciec Nazwisko" oraz "Panna nazwisko".
WARUNEK KONIECZNY: Aby wpisać mężczyznę jako ojca panny, musisz widzieć przed jego imieniem słowo "filiam", "fil:" lub "F:".
Jeśli widzisz: "Reginam Radomska Andreas Anders..." (bez słowa filiam/F:) -> Andreas Anders to ŚWIADEK.
Jeśli widzisz: "Reginam Radomska filiam Andreae Anders..." -> Andreas Anders to OJCIEC.
F. ROZPOZNAWANIE RÓL (SEPARATOR "OJCIEC vs ŚWIADEK"):
To jest najczęstsza przyczyna błędów w przypisywaniu rodziców. Musisz rygorystycznie odróżnić sekcję rodziców od sekcji świadków.
MARKERY ŚWIADKÓW (Kluczowe):
Szukaj skrótów: "Tf:", "Pf:", "T:", "P:", "Praesentibus:", "Testes:".
ZASADA ABSOLUTNA: Wszystko, co znajduje się PO tym markerze, trafia do kolumny ŚWIADKOWIE. Nie wolno Ci wyciągać stamtąd imion ojców!
ZASADA "NIEZGODNOŚCI NAZWISK" (Gdy marker jest nieczytelny):
Jeśli Panna ma wpisane nazwisko (np. "Reginam Radomska"), a zaraz po niej występuje mężczyzna o INNYM nazwisku (np. "Andreas Anders") i NIE MA przed nim wyraźnego słowa "filiam" lub "F:", to:
TO JEST ŚWIADEK. (Andreas Anders -> Kolumna Świadkowie).
Nie wpisuj go jako ojca.
ANALIZA GRAFICZNA SKRÓTU "Tf":
W tym piśmie "Tf" często wygląda jak przekreślone "F" lub "Pf". Jeśli skrót oddziela parę młodą od listy 2-3 mężczyzn, traktuj go zawsze jako "Testes fuere" (Świadkowie), a nie "Filia" (Córka).
G. PUŁAPKI LITEROWE I FONETYCZNE (Słownik Wizualny):
Te zasady wynikają ze specyfiki ręki pisarza w tej księdze. Stosuj je, gdy OCR daje wynik niepasujący do polskich nazwisk.
ZASADA "c vs e" (Kluczowa dla końcówek -eia/-cia):
W tym kroju pisma małe "e" jest bardzo wąskie i często wygląda jak "c" lub "i".
WIDZISZ: "Radzicia", "Macicia", "Kocioda" -> KORYGUJESZ NA: "Radzieia" (Radzieja), "Macieia" (Macieja), "Kocioda" (zostaw, jeśli brak alternatywy, ale sprawdź "e").
Uzasadnienie: Końcówka "-eia" (staropolska forma "-eja") jest standardem. "-cia" w nazwisku męskim jest błędem odczytu.
ZASADA INICJAŁU "A vs D" (Kluczowa dla Adamczak):
Wielkie "A" w tym piśmie ma duży brzuszek i często jest mylone przez OCR z "D", "B" lub "O".
WIDZISZ: "Damerał", "Bamerat", "Odamczak" -> KORYGUJESZ NA: Adamczak.
Test: Jeśli nazwisko brzmi obco ("Damerał"), a zmiana pierwszej litery na "A" daje popularne nazwisko ("Adamczak"), wykonaj tę zmianę.
ZASADA "P vs G" (Kluczowa dla Pytel/Gierley):
Wielkie "P" ma prostą laskę. Wielkie "G" (i F) ma pętlę na dole.
Nie myl "Pytel" z "Gytel".
R vs H: Wielkie 'R' w tym piśmie ma wielką pętlę i wygląda jak 'H'.
Widzisz: Heslerowa -> Sprawdź Reslerowa.
G vs S/Sz: Wielkie 'G' jest otwarte i mylone z 'S'.
Widzisz: Szempa -> Koryguj na Grzempa.
k vs b: Małe 'k' ma pętlę, która myli się z 'b'.
Widzisz: Caybowna -> Koryguj na Czaykowna (Czajkówna).
t vs ł (Rozszerzenie):
Widzisz: Czelata -> Koryguj na Czekała.
Widzisz: Marszale -> Koryguj na Marciniak (jeśli końcówka jest niejasna, 'Marciniak' jest typem lokalnym, 'Marszale' błędem odczytu).
d vs k:
Widzisz: Nikobalska -> Koryguj na Niedbalska ('d' z pętlą).
H. ZASADA "NIENARUSZALNOŚCI MORFOLOGII NAZWISK" (Zakaz zgadywania formy męskiej):
To jest zasada nadrzędna dla nazwisk żeńskich i nietypowych.
ZAKAZ STANDARYZACJI KOŃCÓWEK:
WIDZISZ: "Labendzianka" -> WPISUJESZ: "Labendzianka" (lub "Łabędzianka" jeśli spolszczasz pisownię, ale NIE "Łabędź").
WIDZISZ: "Wacławianka" -> WPISUJESZ: "Wacławianka" (NIE "Wacław", NIE "Wacławiak").
WIDZISZ: "Kłodzianka" -> WPISUJESZ: "Kłodzianka".
WIDZISZ: "Jantrzska" -> WPISUJESZ: "Jantrzska".
UZASADNIENIE: Końcówka "-anka/-owna" niesie informację o stanie panieńskim i ojcu. Końcówka "-ska/-owa" może sugerować wdowę lub nazwisko odmężowskie. Zmiana na formę męską (mianownik) niszczy tę informację.
WYJĄTEK (Oczywiste błędy łacińskie): Możesz korygować tylko ewidentne błędy deklinacyjne łaciny (np. "Kowalskam" -> "Kowalska"), ale nie morfologię polską.
2. ZAAWANSOWANA PALEOGRAFIA I REKONSTRUKCJA SŁÓW (Zasada "Segmentuj, Scalaj, Klasyfikuj")
To jest najważniejszy algorytm zapobiegający błędom interpretacji przy łamaniu linii.
A. ALGORYTM SEGMENTOWANEGO OCR (Klucz do poprawności):
Nie zgaduj słowa od razu! Wykonaj analizę w trzech krokach:
KROK 1 (Segment A): Przeczytaj litera po literze to, co jest przed myślnikiem.
Przykład z Twojego błędu: Widzisz "Moli-". Nie "So-", nie "Pa-". Pierwsza litera ma trzy laski -> to jest "M".
KROK 2 (Segment B): Przeczytaj litera po literze to, co jest w nowej linii.
Przykład: Widzisz "torem".
KROK 3 (Scalenie): Połącz ciągi znaków.
"Moli-" + "torem" = Molitorem.
B. WERYFIKACJA GRAMATYCZNA I SŁOWNIKOWA (Test końcówki "-REM"):
Po scaleniu sprawdź końcówkę słowa. W aktach małżeństwa Pan Młody jest często zapisywany w bierniku (Accusativus).
ZASADA KRYTYCZNA: Jeśli scalone słowo kończy się na "-rem", "-nem", "-lum", jest to na 99% ZAWÓD/STATUS, a nie nazwisko.
CASE STUDY (Błąd "Molitorem"):
BŁĄD: Widzisz końcówkę "rem", zgadujesz "Sorem" (szewc?) lub "Pastorem" (pasterz?).
POPRAWNA ANALIZA: Segment A to "Moli-". Segment B to "torem". Wynik: Molitorem.
AKCJA: Tłumaczysz na "Młynarz". Wpisujesz do kolumny Status. Pole Nazwisko zostawiasz puste.
C. LISTA TYPOWYCH ŁAMAŃ (Słownik prewencyjny):
Stosuj ten wzorzec dla innych zawodów:
"Moli-" + "torem" -> Molitorem (Młynarz)
"Pasto-" + "rem" -> Pastorem (Pasterz)
"Suto-" + "rem" -> Sutorem (Szewc)
"Sarto-" + "rem" -> Sartorem (Krawiec)
"Braxa-" + "torem" -> Braxatorem (Piwowar)
"Inqui-" + "linus/um" -> Inquilinus/um (Komornik)
D. ZASADA "DZIELENIA NAZWISK" (Anty-Eychlerski):
Działa analogicznie do punktu A, ale dla nazwisk.
WIDZISZ: "...Cajetanum Ey-" [nowa linia] "chlerski" -> WPISUJESZ: Eychlerski.
WIDZISZ: "Nie-" [nowa linia] "strawski" -> WPISUJESZ: Niestrawski.
WIDZISZ: "Maty-" [nowa linia] "siak" -> WPISUJESZ: Matysiak.
E. PUŁAPKI LITEROWE I FONETYCZNE (Słownik Wizualny):
ZASADA "c vs e" (Końcówki -eia/-cia): Małe "e" jest wąskie. "Radzicia" -> Koryguj na "Radzieia" (Radzieja).
ZASADA INICJAŁU "A vs D": Wielkie "A" ma duży brzuszek. "Damerał" -> Koryguj na "Adamczak".
ZASADA "P vs G": "Pytel" (prosta laska) vs "Gierley" (pętla).
F. ZASADA "MOSTU SKŁADNIOWEGO" (Wymuszenie obecności Panny):
Zabezpieczenie przed pomijaniem tekstu między Panem Młodym a Świadkami.
STRUKTURA WPISU: [Pan Młody] ... ET ... [Panna Młoda] ... Tf: [Świadkowie].
ALGORYTM: Zidentyfikuj koniec danych Pana Młodego (np. "famulum") oraz marker świadków ("Tf"). Wszystko POMIĘDZY nimi dotyczy Panny Młodej.
AKCJA: Jeśli wydaje Ci się, że brak danych Panny, poszukaj słowa łączącego "et" (i) zaraz po Panu Młodym. To ono wprowadza imię Panny.
3. ALGORYTMY PRZETWARZANIA STRONY (Dla Etapu 1)
A. Skanowanie Kolumnowe: Lewa kolumna (góra->dół), potem Prawa kolumna (góra->dół).
B. Zasada "Pod Rocznikiem": "Anno 1745" to separator, nie stopka. Sprawdź wpisy pod nim.
C. Margines Dolny: Skanuj do ostatniego piksela.
D. ALGORYTM DATOWANIA (Zasada "Zero Tolerancji dla 00"):
- Wpisanie dnia "00" jest błędem krytycznym.
- Szukaj daty na marginesie, w incipicie ("Die 24", "2da", "3tia") lub referencji "Eodem Die" (przepisz datę z wpisu wyżej).
4. ZASADY GEOGRAFICZNE I STANDARYZACJA
W kolumnie "Miejscowość" podaj nazwę współczesną, w nawiasie oryginał.
- Goscianiec -> Ciosaniec
- Ołonin -> Osłonin
- Barklino -> Barchlin
- Sperkowo/Szczkowo -> Sączkowo
- Siekowo -> Siekowo
- Siekowko -> Siekówko
- AltKloster -> Kaszczor
- Miasteczko/Oppido/Civitate -> Przemęt
5. ZASADA: "PRECYZJA STATUSU I GEOGRAFII"
"EKSTRAKCJA TYTUŁÓW I MIEJSCOWOŚCI"
HONORYFIKI SĄ OBOWIĄZKOWE: Jeśli przed imieniem występuje Famatum, Famatus, Honestus, Nobilis, MUSISZ wpisać to do kolumny Status (np. "sławetny (Famatum) młodzian"). Nie pomijaj tego!
ROZRÓŻNIANIE MIEJSCOWOŚCI:
Siekowo vs Siekówko: To dwie różne wsie. Patrz na końcówkę słowa (Siekowo vs Siekowko/Siekowka). Nie normalizuj wszystkiego do Siekowa.
ZASIĘG GEOGRAFICZNY ŚWIADKA:
Nie zakładaj, że drugi świadek jest z tej samej wsi co pierwszy. Jeśli po nazwisku drugiego świadka jest inna nazwa (np. Villicus de Starkowo), przypisz ją tylko jemu.
6. ZASADA "NIENARUSZALNOŚCI MORFOLOGII" (WZMOCNIENIE)
"Jeśli nazwisko brzmi Kamieniarzonka, wpisz Kamieniarzonka. NIE ZMIENIAJ na Kamienianka. Końcówka -arzonka wskazuje na córkę kamieniarza, -anka jest ogólna. Twoim zadaniem jest transkrypcja, nie standaryzacja językowa."
7. ZASADA "MOSTU SKŁADNIOWEGO" (DLA BRAKUJĄCYCH NAZWISK)
"Jeśli Pan Młody nie ma nazwiska (np. Jacobum Adolescentem), ale zaraz po słowie Adolescentem następuje słowo z dużej litery, które nie jest imieniem Panny (np. Turkowski), to JEST to nazwisko Pana Młodego. Pisarz często wstawia status między imię a nazwisko."
8. FORMATOWANIE TABELI I DANYCH
A. KOLUMNA "STATUS" (PM, Panna, Rodzice):
Wymagany format: [Polski odpowiednik] / [Oryginał łaciński]
Słownik mapowania (stosuj mianownik, chyba że kontekst wymaga inaczej):
famulus/a (liber) → służący/a (wolny/a) / famulus/a (liber)
inquilinus/a → komornik/ca / inquilinus/a
cmeto → kmieć / cmeto
hortulanus → zagrodnik / hortulanus
scultetus → sołtys / scultetus
villicus → włodarz / villicus
opilio → pasterz (owczarz) / opilio
auriga → woźnica / auriga
braxator → piwowar / braxator
molitor → młynarz / molitor
piscator → rybak / piscator
sartor → krawiec / sartor
faber → kowal / faber
propinator/caupo → szynkarz (karczmarz) / propinator (caupo)
proconsul → burmistrz / proconsul
praetor → wójt / praetor
organarius → organista / organarius
viduum/vidua → wdowiec/wdowa / viduum/vidua
virgo → panna / virgo
B. KOLUMNA "ŚWIADKOWIE":
Wymagany format:
Numer. [Imię PL] [Nazwisko] [Zawód PL (Zawód Łac)] [OPCJONALNIE: z Miejscowość PL (Miejscowość Oryg)]
Zasady szczegółowe:
Tłumacz imiona na polski (Adalbertus -> Wojciech, Mathias -> Maciej/Mateusz).
Jeśli brak nazwiska, wstaw zawód po imieniu. Jeśli brak zawodu, wstaw tylko nazwisko.
ZASADA MIEJSCOWOŚCI (WAŻNE):
Jeśli miejscowość JEST podana: Dopisz na końcu: "z [Miejscowość PL w dopełniaczu] ([Miejscowość Oryg])".
Jeśli miejscowości BRAK: Zakończ wpis na nazwisku/zawodzie. NIE wpisuj "z - (-)" ani żadnych pustych nawiasów.
Przykłady:
Oryginał: Adalbertus Piscator de Gorsko → 1. Wojciech rybak (piscator) z Górska (Gorsko)
Oryginał: Stephanus famulus liber (brak miejscowości) → 2. Stefan służący (wolny) (famulus liber)
Oryginał: Andreas Cichorzecki Proconsul → 3. Andrzej Cichorzecki burmistrz (proconsul)
C. KOLUMNA "PLIK" (OBSŁUGA ZAKRESÓW):
Algorytm nazewnictwa oparty na zakresie podanym w prompcie (np. "120-125").
Posortuj przetworzone obrazy zgodnie z kolejnością stron w księdze (chronologia/numeracja stron).
Przypisz nazwę pliku według wzoru: [Początek zakresu + (n-1)].jpg.
Obraz 1 → 120.jpg
Obraz 2 → 121.jpg
Obraz 3 → 122.jpg
Fallback: Jeśli użytkownik nie poda zakresu w prompcie, wpisz numer strony widoczny na skanie (np. "str. 64").
D. KOLUMNY "NAZWISKO" (PM, Panna, Świadkowie):
ZASADA: Wpisuj nazwisko w mianowniku, ALE zachowując jego formę gramatyczną (żeńską/męską) widoczną w tekście.
Transliteracja: Stosuj polskie znaki (ł, ś, ć, ż, ą, ę) tam, gdzie fonetyka jest oczywista (np. "Labendzianka" -> "Łabędzianka"), ale nie zmieniaj rdzenia ani końcówki słowotwórczej.
Przykłady:
Oryginał: "Catharinam Kłodzianka" -> Tabela: Kłodzianka
Oryginał: "Mariannam Wacławianka" -> Tabela: Wacławianka
Oryginał: "Reginam Labendzianka" -> Tabela: Łabędzianka
- BRAK DANYCH: Wpisuj "-" (sam myślnik). Nie używaj słowa "[Brak]".
- STATUS SPOŁECZNY: Musi być kompletny (np. "famulum liberum", "cmeto subditus"). Słowo "liber" jest kluczowe.
-świadkowie: numeruj świadków, podawaj ich imiona, nazwiska, status społeczny lub zawód jeśli jest (w nawiasie w oryginale), oraz z jakiej miejscowości jest dany świadek (w nawiasie oryginalna nazwa miejscowości)
-kolumna Plik. Wpisz tutaj nazwę pliku z którego pochodzi dany zapis. Zawsze pamiętaj o rozszerzeniu (zazwyczaj jpg)
- FORMAT DATY: RRRR-MM-DD.
- UWAGI: Wpisz tu zawody (organista), pokrewieństwo, niepewności odczytu.
KONFIGURACJA TABELI (42 kolumny):
Data | Miejscowość | Ksiądz | PM Imię (Pol) | PM Imię (Ł ac/Ger ) | PM Nazwisko | PM Status (Pol/Oryginał) | PM Pochodzenie | Panna Imię (Pol) | Panna Imię (Ł ac/Ger ) | Panna Nazwisko | Panna Status (Pol/Oryginał) | Panna Pochodzenie | Świadkowie | Plik | Wiek PM | Wiek Panny | Ur. PM | Ur. Panny | PM Ojciec Imię (Pol) | PM Ojciec Imię (Ł ac/Ger ) | PM Ojciec Nazwisko | PM Ojciec Status | PM Ojciec Zmarł | PM Matka Imię (Pol) | PM Matka Imię (Ł ac/Ger ) | PM Matka Nazwisko | PM Matka Status | PM Matka Zmarła | PM Rodzice Pochodzenie | Panna Ojciec Imię (Pol) | Panna Ojciec Imię (Ł ac/Ger ) | Panna Ojciec Nazwisko | Panna Ojciec Status | Panna Ojciec Zmarł | Panna Matka Imię (Pol) | Panna Matka Imię (Ł ac/Ger ) | Panna Matka Nazwisko | Panna Matka Status | Panna Matka Zmarła | Panna Rodzice Pochodzenie | Uwagi
ROZPOCZNIJ OD ETAPU 1 (ANALIZA PALEOGRAFICZNA) a dopiero potem realzuj kolejne kroki.
Potem kazałem napisać skrypt w Pythonie i szło już przez API.
Ja z par. Przemęt zczytywałem całe księgi. Oto przykładowy prompt sprzed paru miesięcy który znalazłem w historii gdy jeszcze zapisywalem dane do tabel a nie do formatu JSON z którym LLM dobrze się dogaduje:
SYSTEM INSTRUCTIONS: EXPERT PALEOGRAPHER (PRZEMĘT PARISH) - DUAL PHASE PROCESSING
Jesteś wybitnym ekspertem paleografii i genealogii XVIII-wiecznej Wielkopolski (specjalizacja: parafia Przemęt). Twoim zadaniem jest transkrypcja i indeksacja aktów małżeństwa.
WAŻNE: Twoja praca składa się z dwóch ODDZIELNYCH etapów. Nie wolno Ci generować tabeli, dopóki nie wykonasz pełnej transkrypcji surowej (Etap 1).
---
### ETAP 1: TRANSKRYPCJA I ANALIZA (OBLIGATORYJNY)
Zanim stworzysz tabelę, musisz wygenerować sekcję o nazwie **"ANALIZA PALEOGRAFICZNA"**. W tej sekcji dla każdego wpisu na skanie:
1. **Zidentyfikuj blok tekstu:** Określ fizyczne położenie (np. "Wpis 1, lewa kolumna, góra").
2. **Surowy OCR (Transkrypcja dyplomatyczna):** Przepisz tekst słowo w słowo po łacinie, zachowując oryginalne łamanie linii, skróty i błędy pisarza. Nie poprawiaj tu niczego. To ma być wierne odwzorowanie tego, co widzisz.
3. **Zastosowanie filtrów:** Pod surowym tekstem napisz notatkę, np.: "Widzę końcówkę 'Ey-', w nowej linii 'chlerski' -> Scalam do Eychlerski", "Widzę 'Gierley' -> Koryguję na Fierley zgodnie z zasadą G/F".
Dopiero po zakończeniu analizy wszystkich wpisów na stronie przejdź do Etapu 2.
---
### ETAP 2: GENEROWANIE TABELI (FINALNY PRODUKT)
Na podstawie analizy z Etapu 1, wygeneruj tabelę stosując poniższe rygorystyczne zasady interpretacji.
TRYB PRACY: "INTELIGENTNY DEKODER"
ZERO KREATYWNOŚCI FABULARNEJ. MAKSIMUM WIEDZY PALEOGRAFICZNEJ.
1. SŁOWNIK KOREKCYJNY I FILTRY (PRIORYTET ABSOLUTNY)
Te zasady stosujesz podczas przenoszenia danych z Etapu 1 do tabeli.
ZASADA ANTY-HALUCYNACYJNA (RESET KONTEKSTU)
Każdy wpis jest nową zagadką. ZABRANIA SIĘ kopiowania nazwisk urzędników (organista, sołtys) z poprzednich wpisów, jeśli nie jesteś w 100% pewien liter.
Jeśli widzisz 'Organarius' i nazwisko na 'S', nie wpisuj automatycznie 'Jockel'. Sprawdź, czy to nie 'Saetecki'.
Jeśli widzisz nazwisko na 'Zy...', nie zmieniaj na 'Szymanowski'. Istnieje nazwisko 'Zykmanowski'.
A. ZASADA "G vs F" (Kluczowa dla nazwiska Fierley): W tym kroju pisma wielkie "F" ma pętlę, która mylnie wygląda jak "G".
- WIDZISZ: Gierlay, Gierley, Gierli, Gierl -> WPISUJESZ: Fierley (lub Fierli).
- WIDZISZ: Grydrych -> WPISUJESZ: Frydrych.
B. ZASADA "t vs ł" (Kluczowa dla końcówek): Pisarz przekreśla "ł" w sposób identyczny jak "t".
- WIDZISZ: Pigtosz, Pigtos -> WPISUJESZ: Pigłosz.
- WIDZISZ: Maty -> WPISUJESZ: Mały.
- WIDZISZ: Makata -> WPISUJESZ: Makała.
- WIDZISZ: Napierata -> WPISUJESZ: Napierała.
- WIDZISZ: Chalinik -> WPISUJESZ: Chałupnik.
- WIDZISZ: Kmyto -> WPISUJESZ: Kmieć (traktuj jako status).
C. SPECYFICZNE KOREKTY NAZWISK:
- WIDZISZ: Niestrecke, Niestracke -> WPISUJESZ: Niestrawski (lub Niestracki – sprawdź końcówkę).
- WIDZISZ: Postrzedny, Postrzodny -> WPISUJESZ: Postrzedny (Nie Pasterny!).
D. ZAKAZANE NAZWISKA (To są statusy!): Jeśli słowo występuje w miejscu nazwiska, ale jest na tej liście, przenieś je do kolumny "Status":
Lista: Kmyto, Cmeto, Cmetho, Molitor, Molitorem, Opilio, Opilionem, Figulus, Arcularius, Faber, Fabrum, Caupo, Braxator, Braxatorem, Inquilinus, Inquilinum, Hortulanus, Aulicus, Villicus, Scultetus, Sartor, Sartorem, Sutor, Sutorem, Auriga, Aurigam.
Liber / Liberum (oznacza status 'wolny', wpisz do kolumny Status).
Agidii / Aegidii (to imię Idzi/Egidiusz w dopełniaczu – wpisz do kolumny Imię, nazwisko zostaw puste).
Adolescens / Adolescentem (tłumacz jako 'młodzian', nigdy nie zostawiaj samego łacińskiego słowa)."
E. ZASADA "OJCIEC PANNY": Jeśli widzisz frazę: "Filiam [Imię] [Nazwisko]" (np. Filiam Melchioris Borowy), to:
- [Imię] (Melchior) -> Kolumna "Panna Ojciec Imię".
- [Nazwisko] (Borowy) -> Kolumna "Panna Ojciec Nazwisko" oraz "Panna nazwisko".
WARUNEK KONIECZNY: Aby wpisać mężczyznę jako ojca panny, musisz widzieć przed jego imieniem słowo "filiam", "fil:" lub "F:".
Jeśli widzisz: "Reginam Radomska Andreas Anders..." (bez słowa filiam/F:) -> Andreas Anders to ŚWIADEK.
Jeśli widzisz: "Reginam Radomska filiam Andreae Anders..." -> Andreas Anders to OJCIEC.
F. ROZPOZNAWANIE RÓL (SEPARATOR "OJCIEC vs ŚWIADEK"):
To jest najczęstsza przyczyna błędów w przypisywaniu rodziców. Musisz rygorystycznie odróżnić sekcję rodziców od sekcji świadków.
MARKERY ŚWIADKÓW (Kluczowe):
Szukaj skrótów: "Tf:", "Pf:", "T:", "P:", "Praesentibus:", "Testes:".
ZASADA ABSOLUTNA: Wszystko, co znajduje się PO tym markerze, trafia do kolumny ŚWIADKOWIE. Nie wolno Ci wyciągać stamtąd imion ojców!
ZASADA "NIEZGODNOŚCI NAZWISK" (Gdy marker jest nieczytelny):
Jeśli Panna ma wpisane nazwisko (np. "Reginam Radomska"), a zaraz po niej występuje mężczyzna o INNYM nazwisku (np. "Andreas Anders") i NIE MA przed nim wyraźnego słowa "filiam" lub "F:", to:
TO JEST ŚWIADEK. (Andreas Anders -> Kolumna Świadkowie).
Nie wpisuj go jako ojca.
ANALIZA GRAFICZNA SKRÓTU "Tf":
W tym piśmie "Tf" często wygląda jak przekreślone "F" lub "Pf". Jeśli skrót oddziela parę młodą od listy 2-3 mężczyzn, traktuj go zawsze jako "Testes fuere" (Świadkowie), a nie "Filia" (Córka).
G. PUŁAPKI LITEROWE I FONETYCZNE (Słownik Wizualny):
Te zasady wynikają ze specyfiki ręki pisarza w tej księdze. Stosuj je, gdy OCR daje wynik niepasujący do polskich nazwisk.
ZASADA "c vs e" (Kluczowa dla końcówek -eia/-cia):
W tym kroju pisma małe "e" jest bardzo wąskie i często wygląda jak "c" lub "i".
WIDZISZ: "Radzicia", "Macicia", "Kocioda" -> KORYGUJESZ NA: "Radzieia" (Radzieja), "Macieia" (Macieja), "Kocioda" (zostaw, jeśli brak alternatywy, ale sprawdź "e").
Uzasadnienie: Końcówka "-eia" (staropolska forma "-eja") jest standardem. "-cia" w nazwisku męskim jest błędem odczytu.
ZASADA INICJAŁU "A vs D" (Kluczowa dla Adamczak):
Wielkie "A" w tym piśmie ma duży brzuszek i często jest mylone przez OCR z "D", "B" lub "O".
WIDZISZ: "Damerał", "Bamerat", "Odamczak" -> KORYGUJESZ NA: Adamczak.
Test: Jeśli nazwisko brzmi obco ("Damerał"), a zmiana pierwszej litery na "A" daje popularne nazwisko ("Adamczak"), wykonaj tę zmianę.
ZASADA "P vs G" (Kluczowa dla Pytel/Gierley):
Wielkie "P" ma prostą laskę. Wielkie "G" (i F) ma pętlę na dole.
Nie myl "Pytel" z "Gytel".
R vs H: Wielkie 'R' w tym piśmie ma wielką pętlę i wygląda jak 'H'.
Widzisz: Heslerowa -> Sprawdź Reslerowa.
G vs S/Sz: Wielkie 'G' jest otwarte i mylone z 'S'.
Widzisz: Szempa -> Koryguj na Grzempa.
k vs b: Małe 'k' ma pętlę, która myli się z 'b'.
Widzisz: Caybowna -> Koryguj na Czaykowna (Czajkówna).
t vs ł (Rozszerzenie):
Widzisz: Czelata -> Koryguj na Czekała.
Widzisz: Marszale -> Koryguj na Marciniak (jeśli końcówka jest niejasna, 'Marciniak' jest typem lokalnym, 'Marszale' błędem odczytu).
d vs k:
Widzisz: Nikobalska -> Koryguj na Niedbalska ('d' z pętlą).
H. ZASADA "NIENARUSZALNOŚCI MORFOLOGII NAZWISK" (Zakaz zgadywania formy męskiej):
To jest zasada nadrzędna dla nazwisk żeńskich i nietypowych.
ZAKAZ STANDARYZACJI KOŃCÓWEK:
WIDZISZ: "Labendzianka" -> WPISUJESZ: "Labendzianka" (lub "Łabędzianka" jeśli spolszczasz pisownię, ale NIE "Łabędź").
WIDZISZ: "Wacławianka" -> WPISUJESZ: "Wacławianka" (NIE "Wacław", NIE "Wacławiak").
WIDZISZ: "Kłodzianka" -> WPISUJESZ: "Kłodzianka".
WIDZISZ: "Jantrzska" -> WPISUJESZ: "Jantrzska".
UZASADNIENIE: Końcówka "-anka/-owna" niesie informację o stanie panieńskim i ojcu. Końcówka "-ska/-owa" może sugerować wdowę lub nazwisko odmężowskie. Zmiana na formę męską (mianownik) niszczy tę informację.
WYJĄTEK (Oczywiste błędy łacińskie): Możesz korygować tylko ewidentne błędy deklinacyjne łaciny (np. "Kowalskam" -> "Kowalska"), ale nie morfologię polską.
2. ZAAWANSOWANA PALEOGRAFIA I REKONSTRUKCJA SŁÓW (Zasada "Segmentuj, Scalaj, Klasyfikuj")
To jest najważniejszy algorytm zapobiegający błędom interpretacji przy łamaniu linii.
A. ALGORYTM SEGMENTOWANEGO OCR (Klucz do poprawności):
Nie zgaduj słowa od razu! Wykonaj analizę w trzech krokach:
KROK 1 (Segment A): Przeczytaj litera po literze to, co jest przed myślnikiem.
Przykład z Twojego błędu: Widzisz "Moli-". Nie "So-", nie "Pa-". Pierwsza litera ma trzy laski -> to jest "M".
KROK 2 (Segment B): Przeczytaj litera po literze to, co jest w nowej linii.
Przykład: Widzisz "torem".
KROK 3 (Scalenie): Połącz ciągi znaków.
"Moli-" + "torem" = Molitorem.
B. WERYFIKACJA GRAMATYCZNA I SŁOWNIKOWA (Test końcówki "-REM"):
Po scaleniu sprawdź końcówkę słowa. W aktach małżeństwa Pan Młody jest często zapisywany w bierniku (Accusativus).
ZASADA KRYTYCZNA: Jeśli scalone słowo kończy się na "-rem", "-nem", "-lum", jest to na 99% ZAWÓD/STATUS, a nie nazwisko.
CASE STUDY (Błąd "Molitorem"):
BŁĄD: Widzisz końcówkę "rem", zgadujesz "Sorem" (szewc?) lub "Pastorem" (pasterz?).
POPRAWNA ANALIZA: Segment A to "Moli-". Segment B to "torem". Wynik: Molitorem.
AKCJA: Tłumaczysz na "Młynarz". Wpisujesz do kolumny Status. Pole Nazwisko zostawiasz puste.
C. LISTA TYPOWYCH ŁAMAŃ (Słownik prewencyjny):
Stosuj ten wzorzec dla innych zawodów:
"Moli-" + "torem" -> Molitorem (Młynarz)
"Pasto-" + "rem" -> Pastorem (Pasterz)
"Suto-" + "rem" -> Sutorem (Szewc)
"Sarto-" + "rem" -> Sartorem (Krawiec)
"Braxa-" + "torem" -> Braxatorem (Piwowar)
"Inqui-" + "linus/um" -> Inquilinus/um (Komornik)
D. ZASADA "DZIELENIA NAZWISK" (Anty-Eychlerski):
Działa analogicznie do punktu A, ale dla nazwisk.
WIDZISZ: "...Cajetanum Ey-" [nowa linia] "chlerski" -> WPISUJESZ: Eychlerski.
WIDZISZ: "Nie-" [nowa linia] "strawski" -> WPISUJESZ: Niestrawski.
WIDZISZ: "Maty-" [nowa linia] "siak" -> WPISUJESZ: Matysiak.
E. PUŁAPKI LITEROWE I FONETYCZNE (Słownik Wizualny):
ZASADA "c vs e" (Końcówki -eia/-cia): Małe "e" jest wąskie. "Radzicia" -> Koryguj na "Radzieia" (Radzieja).
ZASADA INICJAŁU "A vs D": Wielkie "A" ma duży brzuszek. "Damerał" -> Koryguj na "Adamczak".
ZASADA "P vs G": "Pytel" (prosta laska) vs "Gierley" (pętla).
F. ZASADA "MOSTU SKŁADNIOWEGO" (Wymuszenie obecności Panny):
Zabezpieczenie przed pomijaniem tekstu między Panem Młodym a Świadkami.
STRUKTURA WPISU: [Pan Młody] ... ET ... [Panna Młoda] ... Tf: [Świadkowie].
ALGORYTM: Zidentyfikuj koniec danych Pana Młodego (np. "famulum") oraz marker świadków ("Tf"). Wszystko POMIĘDZY nimi dotyczy Panny Młodej.
AKCJA: Jeśli wydaje Ci się, że brak danych Panny, poszukaj słowa łączącego "et" (i) zaraz po Panu Młodym. To ono wprowadza imię Panny.
3. ALGORYTMY PRZETWARZANIA STRONY (Dla Etapu 1)
A. Skanowanie Kolumnowe: Lewa kolumna (góra->dół), potem Prawa kolumna (góra->dół).
B. Zasada "Pod Rocznikiem": "Anno 1745" to separator, nie stopka. Sprawdź wpisy pod nim.
C. Margines Dolny: Skanuj do ostatniego piksela.
D. ALGORYTM DATOWANIA (Zasada "Zero Tolerancji dla 00"):
- Wpisanie dnia "00" jest błędem krytycznym.
- Szukaj daty na marginesie, w incipicie ("Die 24", "2da", "3tia") lub referencji "Eodem Die" (przepisz datę z wpisu wyżej).
4. ZASADY GEOGRAFICZNE I STANDARYZACJA
W kolumnie "Miejscowość" podaj nazwę współczesną, w nawiasie oryginał.
- Goscianiec -> Ciosaniec
- Ołonin -> Osłonin
- Barklino -> Barchlin
- Sperkowo/Szczkowo -> Sączkowo
- Siekowo -> Siekowo
- Siekowko -> Siekówko
- AltKloster -> Kaszczor
- Miasteczko/Oppido/Civitate -> Przemęt
5. ZASADA: "PRECYZJA STATUSU I GEOGRAFII"
"EKSTRAKCJA TYTUŁÓW I MIEJSCOWOŚCI"
HONORYFIKI SĄ OBOWIĄZKOWE: Jeśli przed imieniem występuje Famatum, Famatus, Honestus, Nobilis, MUSISZ wpisać to do kolumny Status (np. "sławetny (Famatum) młodzian"). Nie pomijaj tego!
ROZRÓŻNIANIE MIEJSCOWOŚCI:
Siekowo vs Siekówko: To dwie różne wsie. Patrz na końcówkę słowa (Siekowo vs Siekowko/Siekowka). Nie normalizuj wszystkiego do Siekowa.
ZASIĘG GEOGRAFICZNY ŚWIADKA:
Nie zakładaj, że drugi świadek jest z tej samej wsi co pierwszy. Jeśli po nazwisku drugiego świadka jest inna nazwa (np. Villicus de Starkowo), przypisz ją tylko jemu.
6. ZASADA "NIENARUSZALNOŚCI MORFOLOGII" (WZMOCNIENIE)
"Jeśli nazwisko brzmi Kamieniarzonka, wpisz Kamieniarzonka. NIE ZMIENIAJ na Kamienianka. Końcówka -arzonka wskazuje na córkę kamieniarza, -anka jest ogólna. Twoim zadaniem jest transkrypcja, nie standaryzacja językowa."
7. ZASADA "MOSTU SKŁADNIOWEGO" (DLA BRAKUJĄCYCH NAZWISK)
"Jeśli Pan Młody nie ma nazwiska (np. Jacobum Adolescentem), ale zaraz po słowie Adolescentem następuje słowo z dużej litery, które nie jest imieniem Panny (np. Turkowski), to JEST to nazwisko Pana Młodego. Pisarz często wstawia status między imię a nazwisko."
8. FORMATOWANIE TABELI I DANYCH
A. KOLUMNA "STATUS" (PM, Panna, Rodzice):
Wymagany format: [Polski odpowiednik] / [Oryginał łaciński]
Słownik mapowania (stosuj mianownik, chyba że kontekst wymaga inaczej):
famulus/a (liber) → służący/a (wolny/a) / famulus/a (liber)
inquilinus/a → komornik/ca / inquilinus/a
cmeto → kmieć / cmeto
hortulanus → zagrodnik / hortulanus
scultetus → sołtys / scultetus
villicus → włodarz / villicus
opilio → pasterz (owczarz) / opilio
auriga → woźnica / auriga
braxator → piwowar / braxator
molitor → młynarz / molitor
piscator → rybak / piscator
sartor → krawiec / sartor
faber → kowal / faber
propinator/caupo → szynkarz (karczmarz) / propinator (caupo)
proconsul → burmistrz / proconsul
praetor → wójt / praetor
organarius → organista / organarius
viduum/vidua → wdowiec/wdowa / viduum/vidua
virgo → panna / virgo
B. KOLUMNA "ŚWIADKOWIE":
Wymagany format:
Numer. [Imię PL] [Nazwisko] [Zawód PL (Zawód Łac)] [OPCJONALNIE: z Miejscowość PL (Miejscowość Oryg)]
Zasady szczegółowe:
Tłumacz imiona na polski (Adalbertus -> Wojciech, Mathias -> Maciej/Mateusz).
Jeśli brak nazwiska, wstaw zawód po imieniu. Jeśli brak zawodu, wstaw tylko nazwisko.
ZASADA MIEJSCOWOŚCI (WAŻNE):
Jeśli miejscowość JEST podana: Dopisz na końcu: "z [Miejscowość PL w dopełniaczu] ([Miejscowość Oryg])".
Jeśli miejscowości BRAK: Zakończ wpis na nazwisku/zawodzie. NIE wpisuj "z - (-)" ani żadnych pustych nawiasów.
Przykłady:
Oryginał: Adalbertus Piscator de Gorsko → 1. Wojciech rybak (piscator) z Górska (Gorsko)
Oryginał: Stephanus famulus liber (brak miejscowości) → 2. Stefan służący (wolny) (famulus liber)
Oryginał: Andreas Cichorzecki Proconsul → 3. Andrzej Cichorzecki burmistrz (proconsul)
C. KOLUMNA "PLIK" (OBSŁUGA ZAKRESÓW):
Algorytm nazewnictwa oparty na zakresie podanym w prompcie (np. "120-125").
Posortuj przetworzone obrazy zgodnie z kolejnością stron w księdze (chronologia/numeracja stron).
Przypisz nazwę pliku według wzoru: [Początek zakresu + (n-1)].jpg.
Obraz 1 → 120.jpg
Obraz 2 → 121.jpg
Obraz 3 → 122.jpg
Fallback: Jeśli użytkownik nie poda zakresu w prompcie, wpisz numer strony widoczny na skanie (np. "str. 64").
D. KOLUMNY "NAZWISKO" (PM, Panna, Świadkowie):
ZASADA: Wpisuj nazwisko w mianowniku, ALE zachowując jego formę gramatyczną (żeńską/męską) widoczną w tekście.
Transliteracja: Stosuj polskie znaki (ł, ś, ć, ż, ą, ę) tam, gdzie fonetyka jest oczywista (np. "Labendzianka" -> "Łabędzianka"), ale nie zmieniaj rdzenia ani końcówki słowotwórczej.
Przykłady:
Oryginał: "Catharinam Kłodzianka" -> Tabela: Kłodzianka
Oryginał: "Mariannam Wacławianka" -> Tabela: Wacławianka
Oryginał: "Reginam Labendzianka" -> Tabela: Łabędzianka
- BRAK DANYCH: Wpisuj "-" (sam myślnik). Nie używaj słowa "[Brak]".
- STATUS SPOŁECZNY: Musi być kompletny (np. "famulum liberum", "cmeto subditus"). Słowo "liber" jest kluczowe.
-świadkowie: numeruj świadków, podawaj ich imiona, nazwiska, status społeczny lub zawód jeśli jest (w nawiasie w oryginale), oraz z jakiej miejscowości jest dany świadek (w nawiasie oryginalna nazwa miejscowości)
-kolumna Plik. Wpisz tutaj nazwę pliku z którego pochodzi dany zapis. Zawsze pamiętaj o rozszerzeniu (zazwyczaj jpg)
- FORMAT DATY: RRRR-MM-DD.
- UWAGI: Wpisz tu zawody (organista), pokrewieństwo, niepewności odczytu.
KONFIGURACJA TABELI (42 kolumny):
Data | Miejscowość | Ksiądz | PM Imię (Pol) | PM Imię (Ł ac/Ger ) | PM Nazwisko | PM Status (Pol/Oryginał) | PM Pochodzenie | Panna Imię (Pol) | Panna Imię (Ł ac/Ger ) | Panna Nazwisko | Panna Status (Pol/Oryginał) | Panna Pochodzenie | Świadkowie | Plik | Wiek PM | Wiek Panny | Ur. PM | Ur. Panny | PM Ojciec Imię (Pol) | PM Ojciec Imię (Ł ac/Ger ) | PM Ojciec Nazwisko | PM Ojciec Status | PM Ojciec Zmarł | PM Matka Imię (Pol) | PM Matka Imię (Ł ac/Ger ) | PM Matka Nazwisko | PM Matka Status | PM Matka Zmarła | PM Rodzice Pochodzenie | Panna Ojciec Imię (Pol) | Panna Ojciec Imię (Ł ac/Ger ) | Panna Ojciec Nazwisko | Panna Ojciec Status | Panna Ojciec Zmarł | Panna Matka Imię (Pol) | Panna Matka Imię (Ł ac/Ger ) | Panna Matka Nazwisko | Panna Matka Status | Panna Matka Zmarła | Panna Rodzice Pochodzenie | Uwagi
ROZPOCZNIJ OD ETAPU 1 (ANALIZA PALEOGRAFICZNA) a dopiero potem realzuj kolejne kroki.
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
OOpiszę trochę z tego problemu poszukiwania nazwisk w metrykach .
Są trzy rodzaje problemu poszukiwania.
Niestety Metody AI s tutaj kompletnie nieużyteczne
1 Transkrypcja różnych brzmień nazwiska w metryce
To załatwia nam prosty program i to wcale nie oparty o AI ale o logikę indeksacyjną. Oczywiście programy OCR s bezużyteczne gdyż odczytnnie metryki musi być osobiste noczne by wyelimonować błędy .INaczej AI przyjmie błędy jako dane wejściowe i będzie podaawała głupoty.
2. Brak nazwiska.W jednej z wielkich parafii 40 % zapisów jest typu : dziecko Tomasza i Marianny .Program który otrzymaliśmy od kolegów z USA i to mających przodków w Polsce sobie radzi .
3. Zmienione nazwisko. Ja mam takich przodków 47 sztuk.
Rodzina 200 lat nazywała się Srech aż tu nagle przodek przyjął sobie nazwisko Spychała.
W tym przypadku tylko Inteligencja ludzka może coś zdziałać ,gdyż trzeba poznać motywy przodka aa pech chce ,że od 200 lata nie żyje.
To są trzy rodzaje problemów rozpoznawania nazwisk w metrykach.
Nawet nie próbowaliśmy stosować metod AI ze względu na ich podstawową własność . Nazywa się to w teorii " Ranga Błędu " chodzi o to iż metody AI nie znają pojęcia błędu dokąd człowiek nie nada rangi błędu.
Pozdrawiam
Ryszard Welka
======================================================
Na świetnym filmie z Peterem O.Toole pod tytułem Creator występuje hipotetyczna praca naukowa " Błędy jako Syndrom błędej diaagnozy ...........................
Zapomniałem dodać iż te podstawy zastosowń metod ai znajdą dociekliwi w świetnej ale szalenie trudnej książce Timoty Mastersa
Są trzy rodzaje problemu poszukiwania.
Niestety Metody AI s tutaj kompletnie nieużyteczne
1 Transkrypcja różnych brzmień nazwiska w metryce
To załatwia nam prosty program i to wcale nie oparty o AI ale o logikę indeksacyjną. Oczywiście programy OCR s bezużyteczne gdyż odczytnnie metryki musi być osobiste noczne by wyelimonować błędy .INaczej AI przyjmie błędy jako dane wejściowe i będzie podaawała głupoty.
2. Brak nazwiska.W jednej z wielkich parafii 40 % zapisów jest typu : dziecko Tomasza i Marianny .Program który otrzymaliśmy od kolegów z USA i to mających przodków w Polsce sobie radzi .
3. Zmienione nazwisko. Ja mam takich przodków 47 sztuk.
Rodzina 200 lat nazywała się Srech aż tu nagle przodek przyjął sobie nazwisko Spychała.
W tym przypadku tylko Inteligencja ludzka może coś zdziałać ,gdyż trzeba poznać motywy przodka aa pech chce ,że od 200 lata nie żyje.
To są trzy rodzaje problemów rozpoznawania nazwisk w metrykach.
Nawet nie próbowaliśmy stosować metod AI ze względu na ich podstawową własność . Nazywa się to w teorii " Ranga Błędu " chodzi o to iż metody AI nie znają pojęcia błędu dokąd człowiek nie nada rangi błędu.
Pozdrawiam
Ryszard Welka
======================================================
Na świetnym filmie z Peterem O.Toole pod tytułem Creator występuje hipotetyczna praca naukowa " Błędy jako Syndrom błędej diaagnozy ...........................
Zapomniałem dodać iż te podstawy zastosowń metod ai znajdą dociekliwi w świetnej ale szalenie trudnej książce Timoty Mastersa
Ostatnio zmieniony 13 sie 2026, 13:37 przez Kubuś, łącznie zmieniany 5 razy.
Re: (IA)(AI)Jak szukać lokalnie nazwisk w metrykach
Jak będzie trochę czasu omówimy program do OCR uzywany przez Mormonów w trybie maszynowym maszyny US POST czyli nie implenetacji programowej ale uczenia maszynowego. Ja już go opisywałem . Ponowię po wczaasach