Przejdź do głównej zawartości

Posty

Aktualizacja słownika ortograficznego w programie LanguageTool 5.8

Przygotowałem aktualizację słownika ortograficznego stosowanego w programie LanguageTool (będzie dostępna publicznie w nowym wydaniu, 5.8, planowanym na koniec czerwca). Słownik oparty jest przede wszystkim na słownikach dostępnych na sjp.pl , lecz usunąłem trochę mylących wpisów (np. niezalecaną formę „ grejfrut ”) i dodałem trochę funkcji (typu wyrazy pisane z łącznikiem), które są potrzebne. Zdumiało mnie, że poprzednia wersja słownika pochodziła z roku 2008. No cóż, ta zmiana się po prostu należała. W kolejce jest aktualizacja paczki słowników do LibreOffice/OpenOffice.

Walery Pisarek — Słownik języka niby-polskiego

Małopolska Biblioteka Cyfrowa udostępnia książkę profesora Walerego Pisarka Słownik języka niby-polskiego w formacie PDF.   Co prawda, opisane w niej błędy w większości pochodzą z prasy z lat siedemdziesiątych, ale wiele błędów typowych dla napuszonego i pretensjonalnego języka niestety trzyma się nadal w polszczyźnie.

polimorfologik 2.1

Od ostatniego wydania słowników morfosyntaktycznych z serii Morfologik minęło trochę czasu, a warto było wprowadzić trochę kosmetycznych poprawek, m.in. usunąć niepotrzebne formy (takie jak czasowniki „dzienić”, „bożyć” czy „cienić”) oraz dodać trochę geograficznych nazw własnych. Nowe wydanie dostępne jest na githubie: Polimorfologik 2.1 . W pliku opis zmian plus wersje tekstowe i binarne słowników.

Słownik poprawnej polszczyzny Stanisława Szobera online

Cyfryzacja polskich zasobów przynosi czasem bardzo interesujące efekty. Jednym z nich jest pojawienie się nieco już starego, ale nadal przydatnego Słownika poprawnej polszczyzny Stanisława Szobera  w Repozytorium Cyfrowym Instytutów Naukowych. Cały słownik jest dostępny w formacie PDF, który można przeszukiwać. Wiele porad się zdezaktualizowało (potępiane błędy czy formy zanikły – kiedyś np. Szober potępiał formę posełka stosowaną zamiast poprawnej „posłanka”), ale niektóre nadal są dorzeczne.

LanguageTool 2.5

Dzisiaj wydaliśmy nową wersję LanguageTool 2.5 . W języku polskim sporo zmian, co widać na odpowiedniej stronie podsumowującej . Krótko mówiąc: wykrywa więcej błędów, jest mniej fałszywych alarmów. Sporo zmian także w części angielskiej i ukraińskiej, stabilnie rozwija się też obsługa katalońskiego i rosyjskiego. Użytkownicy Libre/OpenOffice mogą po prostu zaktualizować rozszerzenie: Narzędzia > Menedżer rozszerzeń > Sprawdź aktualizacje .

LanguageTool 2.4 na Nowy Rok!

Dzisiaj wydaliśmy nową wersję korektora gramatycznego LanguageTool 2.4 . Ta wersja zawiera sporo poprawek i nowych reguł dla różnych języków, w tym wiele reguł wykrywających błędy w użyciu dywizu (łącznika) i myślnika w języku polskim. Korzysta także ze słownika frekwencyjnego przy generowaniu proponowanych poprawek podczas sprawdzania pisowni. Poza tym można zobaczyć przykłady wykrywanych błędów w interfejsie samodzielnym Program wymaga zainstalowania środowiska Java co najmniej w wersji 7 . Instalacja w programach OpenOffice i LibreOffice Dwukrotnie kliknij pobrany plik LanguageTool-2.4.oxt . Jeśli w systemie jest zarejestrowane rozszerzenie .oxt (robią to aktualne wersje OpenOffice i wszystkie wersje LibreOffice), nastąpi uruchomienie instalatora. W razie problemów Należy upewnić się, czy w systemie zainstalowana jest Java w wersji co najmniej 7. Środowisko GIJ ma błędy uniemożliwiające użytkowanie LT; należy korzystać z Javy w wersji IcedTea lub firmy Oracle. Ta wersja ś...

Korekta pisowni z wykorzystaniem częstości wyrazów

W wydanej niedawno wersji 1.8.2 biblioteki morfologik-stemming (dostępna w repozytoriach Mavena) wprowadziliśmy możliwość wykorzystywania frekwencji wyrazów przy generowaniu podpowiedzi. Dzięki temu proponowane są najpierw wyrazy częstsze, co może być ułatwieniem zwłaszcza wtedy, gdy wyraz z literówką jest dosyć krótki. Np. wyraz „ kótki ” w obecnej wersji słownika będzie poprawiany na: kotki; Kutki; krótki; skutki; kostki; kulki; kurtki (jest jeszcze kilkanaście innych propozycji o takiej samej odległości edycyjnej, tj. z taką samą liczbą zmienionych liter w stosunku do wyrazu z błędem). Uporządkowanie, jak widać, jest dosyć sensowne. Jako źródło danych frekwencyjnych wykorzystać można dane z projektu Mozilla Gaia  dostępne na licencji Apache (część z danych pochodzi z danych klawiaturowych Androida). Słownik frekwencyjny będzie wykorzystany w najnowszej wersji LanguageTool. Polecam skorzystanie z korektora pisowni bezpośrednio z LT we własnych aplikacjach  w Javi...

morfologik-stemming 1.7 released

We just released a new version of morfologik-stemming library to Maven. Most changes are related to the new module morfologik-speller, which can now use spelling dictionaries configured with property files. In particular, it introduces support for character classes, i.e., you can introduce equivalent characters as with hunspell's MAP feature. It also supports replacement patterns (just like the ones defined by REP command in hunspell). A short description of new properties is given in the LanguageTool wiki .

O Morfologiku w zastosowaniu praktycznym...

Na blogu Oracle Gridwise Tech można poczytać o wykorzystaniu Morfologika do analizy danych tekstowych na dużą skalę ( text mining ). Od siebie dodam, że warto nierozpoznany tekst poddać testowi ortograficznemu, do czego przyda się klasa Speller. W wersji obecnie dostępnej Speller nie potrafi uzupełniać polskich liter, ale już niedługo, za momencik będzie wersja, która sobie z tym radzi.

morfologik-stemming 1.6.0

10 marca opublikowaliśmy nową wersję biblioteki morfologik-stemming. Nowa wersja zawiera nowy słownik Morfologik 2.0 PoliMof. Wycofaliśmy też słownik SGJP, gdyż jest on w dużej mierze uwzględniony w nowym słowniku, a jego zawartość tak czy inaczej nie odpowiadała ortograficznej segmentacji (tzn. uznaniu, że podstawowe jednostki to tzw. wyrazy ortograficzne), a innego rodzaju segmentacji biblioteka morfologik-stemming nie obsługuje. Jeśli będzie jednak takie zapotrzebowanie, możemy zaimplementować segmentację w stylu Morfeusza. Najnowsze pliki dostępne są w repozytoriach Mavena i na sourceforge.net .

Morfologik 2.0 PoliMorf

Dziś udostępniłem ostateczną wersję słownika morfosyntaktycznego Morfologik 2.0 PoliMorf. Słownik PoliMorf powstał z połączenia słowników SGJP i Morfologik, obecnie jest poprawiany przez lingwistów w Zespole Inżynierii Lingwistycznej IPI PAN. Zachowano tagset Morfologika wraz z zasadami segmentacji wyrazów wg białych znaków (inaczej niż w Morfeuszu), przy czym wprowadzono lepszy opis atrybutu zwrotności: teraz każdy czasownik ma wartość ( nonrefl  niezwrotny,  refl  zwrotny, a  nonrefl.refl  taki, który może być raz zwrotny, a raz nie). Słownik składa się wyłącznie z generowanego automatycznie eksportu z Kuźni Leksemów, z niewielkim wyjątkiem dla skrótów (słowa ze znacznikiem  brev ), które nadal dodawane są osobno. Skrypt poprawia też błędny wpis wyrazu „bardziej”. W stosunku do wydania RC2 poprawiono oznaczenie wyrazu „się” (brakowało form ze znacznikiem siebie), uzupełniono brakujące znaczniki kilku rzadkich nieodmiennych rzeczowników (toto, wasze...

Morfologik 2.0 RC2

I mamy wersję RC2, w której poprawiłem kilka drobiazgów: poprawnie wygenerowałem plik polish.dict z pliku polimorfologik.txt; poprawiłem daty, dodałem numery wersji; usunąłem wadliwy opis wyrazu „bardziej” i wstawiłem poprawny; usunąłem prefiksy i sufiksy, bo one i tak nie są rozpoznawane przez naszą bibliotekę, więc tylko psuły dane; usunąłem formy archaiczne z SGJP. Pliki nadal tam, gdzie poprzednio .

Morfologik 2.0 PoliMorf (RC1)

Długo ociągałem się z nowym wydaniem Morfologika, bo zmian w procesie generowania słownika było na tyle dużo, że jest to obecnie zupełnie nowa jakość. Dziś udostępniam wersję wstępną, bo być może występują w plikach tak duże niezgodności, że coś się komuś popsuje. Największe zmiany w skrócie: Słownik PoliMorf powstał z połączenia słowników SGJP i Morfologik, obecnie jest poprawiany przez lingwistów w Zespole Inżynierii Lingwistycznej IPI PAN. Zachowano tagset Morfologika wraz z zasadami segmentacji wyrazów wg białych znaków (inaczej niż w Morfeuszu), przy czym wprowadzono lepszy opis atrybutu zwrotności: teraz każdy czasownik ma wartość ( nonrefl niezwrotny, refl zwrotny, a nonrefl.refl taki, który może być raz zwrotny, a raz nie). Słownik składa się wyłącznie z generowanego automatycznie eksportu z Kuźni Leksemów, z niewielkim wyjątkiem dla skrótów (słowa ze znacznikiem brev ), które nadal dodawane są osobno. W tym wydaniu udostępniam pliki, w których jedna forma występuj...

LanguageTool 2.0 na nowy rok

Na nowy rok wydaliśmy nową wersję korektora LanguageTool. Zmiany są w większości kosmetyczne, a większość poprawek dotyczy innych języków niż polski. Instrukcja instalacji znajduje się na polskiej stronie korektora LanguageTool . Większą nowością jest dodatek LanguageTool do przeglądarki Firefox . Jego użycie wymaga albo lokalnej instalacji korektora LanguageTool (jako osobnego programu, nie dodatku do LibreOffice) i uruchomienia serwera, albo użycia serwera, który udostępniamy w Internecie. Instrukcje znajdują się na stronie rozszerzenia. Szczęśliwego Nowego Roku 2013!

LanguageTool 1.9

30 września wydaliśmy nową wersję korektora LanguageTool. Nie informowałem o niej wcześniej, bo nowy rok akademicki po prostu mnie mocno pochłonął... W tej wersji jest bardzo dużo zmian, m.in. powstały dwie wersje LanguageTool do pobrania: rozszerzenie LibreOffice/Apache OpenOffice ( plik .oxt ) i  wersja samodzielna . Z nowości: wstępna obsługa języka japońskiego, aktualizacje reguł dla wielu języków, poprawki błędów. Instalacja rozszerzenia Zalecamy stosowanie LibreOffice 3.5.4 lub Apache OpenOffice 3.5.4 ze względu na poprawkę istotnego błędu, który obniżał sprawność dodatków w Javie. W programie OpenOffice.org 3.0.1 lub nowszym, a także w LibreOffice Metoda prosta Dwukrotnie kliknij pobrany plik LanguageTool-stable.oxt. Jeśli w systemie jest zarejestrowane rozszerzenie .oxt (robią to aktualne wersje OpenOffice.org i wszystkie wersje LibreOffice), nastąpi uruchomienie instalatora. Metoda tradycyjna Kliknij polecenie Narzędzia > Menedżer rozszerzeń ...

morfologik-stemming 1.5.4

Wydaliśmy dziś nową wersję biblioteki morfologik-stemming 1.5.4 . Zmiany są niewielkie i dotyczą jedynie korektora pisowni opartego na automatach skończonych. Korektor w tej wersji obsługuje automaty z kodowaniem UTF-8, dzięki czemu mógł zastąpić bardzo powolnego hunspella (hunspell przetwarza na moim komputerze około 56 zdań na sekundę, a LanguageTool z korektorem morfologik-speller około 1400). Biblioteka morfologik-speller nie jest jeszcze zupełnie gotowa, bo nie przywraca znaków diakrytycznych i nie ma możliwości budowania automatów z morfologią dwustopniową (którą zawiera hunspell), ale te funkcje są w planach.

LanguageTool 1.8

30 czerwca wydaliśmy nową wersję korektora LanguageTool. W tej wersji jest bardzo dużo zmian, m.in. powstały dwie wersje LanguageTool do pobrania: rozszerzenie LibreOffice/Apache OpenOffice ( plik .oxt ) i wersja samodzielna . Wersja samodzielna wyposażona została w korektory pisowni, oparte na hunspellu (który niestety jest bardzo powolny) lub własnym korektorze, opartym na algorytmie fsa_spell . Oprócz tego sporo poprawek błędów, aktualizacja słownika morfosyntaktycznego (obecnie jest to Morfologik 1.9) i trochę nowych reguł, a także warianty języków (m.in. rozróżniamy angielski brytyjski od amerykańskiego). Wprowadziliśmy też wstępną obsługę greckiego i portugalskiego. Instalacja rozszerzenia Zalecamy stosowanie LibreOffice 3.5.4 lub Apache OpenOffice 3.5.4 ze względu na poprawkę istotnego błędu, który obniżał sprawność dodatków w Javie. W programie OpenOffice.org 3.0.1 lub nowszym, a także w LibreOffice Metoda prosta Dwukrotnie kliknij pobrany plik LanguageToo...

morfologik-stemming 1.5.3

Skoro jest nowy słownik, to jest i nowa biblioteka morfologik-stemming. Poza zmianą słownika (i licencji!) znalazły się w niej tylko dwie zmiany: poprawka drobnego błędu oraz prosty algorytm korekty pisowni (przeniesiony z fsa_spell, czyli implementacja algorytmu Kemala Oflazera ).

Morfologik 1.9

Właśnie pojawił się nowiutki Morfologik 1.9 . Jest to prawdopodobnie ostatnie wydanie Morfologika osobno od słownika PoliMorf , który powstaje na bazie Słownika Gramatycznego Języka Polskiego i starej bazy Morfologika. W tym wydaniu mamy wiele zmian, przede wszystkim wynikających z połączenia zasobów. Kodowanie zmieniono na UTF-8, bo niektóre nazwiska obce, odmieniane po polsku, inaczej nie dałyby się poprawnie zapisać. Z PoliMorfa do słownika przejęto wszystkie formy rzeczownikowe, przymiotnikowe, rzeczowniki odsłowne, imiesłowy i formy deprecjatywne. Pozostawiono jedynie formy czasownikowe (a to tylko w oczekiwaniu na możliwość eksportu z narzędzia służącego do tworzenia PoliMorfa, a mianowicie z Kuźni, czasowników w notacji nieposegmentowanej wewnętrznie). Jedynym wyjątkiem jest wyraz „Pablo”, który był analizowany także jako nieodmienny. To nie było zgodne z regułami LanguageToola, więc w Morfologiku Pabla trzeba odmieniać. Zmiana licencji. Przyjęto najprostszą możliwą 2-kla...

LanguageTool 1.7

25 marca wydaliśmy nową wersję korektora LanguageTool. Zmiany są zasadniczo kosmetyczne, w języku polskim reguły nie uległy zmianie (tu można zobaczyć aktualizacje reguł ). Instalacja W programie OpenOffice.org 3.0.1 lub nowszym, a także w LibreOffice Metoda prosta Dwukrotnie kliknij pobrany plik LanguageTool-stable.oxt. Jeśli w systemie jest zarejestrowane rozszerzenie .oxt (robią to aktualne wersje OpenOffice.org i wszystkie wersje LibreOffice), nastąpi uruchomienie instalatora. Metoda tradycyjna Kliknij polecenie Narzędzia > Menedżer rozszerzeń > Dodaj, a następnie wybierz plik LanguageTool-1.6.oxt. Zamknij pakiet (łącznie z modułem szybkiego uruchamiania). Po ponownym otwarciu OpenOffice.org / LibreOffice będzie możliwe automatyczne sprawdzanie tekstu. Jako test wpisz zdanie: „To zdanie zdanie jest z błędem”. Bez programu OpenOffice.org / LibreOffice Rozpakuj archiwum LanguageTool-stable.oxt (jest to plik w formacie .zip) i uruchom plik LanguageToolGui.jar, klikając go dwukro...