Konverze txt do dic

Převod souboru TXT do DIC

Formátujte seznam slov TXT pro slovníky plain-list, Hunspell nebo aplikačně specifické DIC.

Převádějte soubory TXT online

Pro převod TXT do DIC zatím vlastní online konvertor nemáme, ale soubory TXT můžete online převést do těchto a dalších formátů:

Jak převést soubor txt do formátu dic

Vlastní nástroje pro kontrolu pravopisu, nástroje pro terminologii a slovníkové enginy často přijímají slovní zásobu pouze v konkrétním rozložení .dic. Seznam slov udržovaný v souboru .txt je proto nutné vyčistit a naformátovat tak, aby odpovídal cílovému programu, nikoli pouze přejmenovat.

Soubory TXT a jejich použití

Soubor .txt je prostý text bez požadované struktury polí. Textové editory jako Notepad, TextEdit, Notepad++ a VS Code vytvářejí soubory TXT; tabulkové procesory, databáze, systémy pro správu terminologie a skripty do nich běžně exportují seznamy slov.

Zdrojový soubor může obsahovat jedno slovo na řádku, výrazy oddělené čárkami, nadpisy, definice, duplicity nebo běžný text. Do slovníkového souboru by měly být vloženy pouze extrahované a ověřené výrazy.

Soubory DIC a jejich varianty

Přípona .dic neoznačuje jeden univerzální formát slovníku. Některé aplikace používají seznam slov v UTF-8 s jednou položkou na řádku, zatímco jiné používají slovníky kompatibilní s Hunspell, proprietární textová rozložení nebo binární soubory.

Soubor Hunspell .dic obvykle obsahuje na prvním řádku počet slov a poté položky, například colour/AB. Volitelné příznaky jsou definovány odpovídajícím souborem .aff, který určuje kódování, pravidla pro afixy, pravidla pro složená slova a významy příznaků. Soubor DIC bez správného souboru AFF nemůže sám o sobě přidat platná pravidla pro skloňování a časování.

Správně naformátovaný soubor DIC umožňuje cílovému softwaru rozpoznávat schválené názvy, technické termíny, zkratky a pravopisné varianty. Slovníky ve formě prostého seznamu jsou kompaktní a snadno se upravují, ale rozpoznávají pouze doslovné položky, které obsahují, pokud aplikace nepodporuje vlastní pravidla morfologie.

Příprava zdrojového seznamu

  1. Prostudujte dokumentaci cílového programu a otevřete známý funkční slovníkový soubor ve VS Code nebo Notepad++. Zaznamenejte jeho název souboru, kódování, první řádky, požadované doprovodné soubory a syntaxi položek.
  2. Otevřete zdrojový soubor TXT a odstraňte nadpisy, definice, prázdné řádky, položky obsahující pouze interpunkci a výrazy, které kontrola pravopisu nesmí přijímat.
  3. Umístěte každou přijatou položku na samostatný řádek. Fráze ponechte pouze tehdy, pokud formát slovníku cílové aplikace podporuje víceslovné položky.
  4. Před odstraněním duplicit zvolte pravidla pro velikost písmen. Názvy produktů a zkratky mohou vyžadovat samostatné položky pro Acme, ACME a acme.
  5. Vyčištěný zdroj uložte jako UTF-8, pokud cílový slovník výslovně nevyžaduje jiné kódování.

Vytvoření požadovaného formátu DIC

U aplikace, která dokumentuje formát DIC jako prostý seznam slov, uložte vyčištěný seznam s požadovaným názvem souboru .dic pomocí File → Save As. Změna přípony je platná pouze tehdy, když aplikace výslovně považuje svůj soubor DIC za seznam v podobě prostého textu.

Pro cíl Hunspell zkopírujte syntaxi jeho existujícího slovníku a použijte odpovídající soubor .aff. Pokud to ukázkový slovník cílového systému vyžaduje, uveďte na prvním řádku požadovaný počet položek; řádek s počtem se nezapočítává. Příznaky přidávejte pouze tehdy, jsou-li definovány v daném souboru AFF. Libovolné příznaky nevytvoří množná čísla, slovesné tvary ani složená slova.

V PowerShell 7 tento příkaz ořízne zdroj ve formátu UTF-8 s jedním výrazem na řádek, odstraní přesně duplicitní řádky, přidá počet ve stylu Hunspell a zapíše soubor UTF-8 bez značky pořadí bajtů:

$w = Get-Content words.txt | ForEach-Object { $_.Trim() } | Where-Object { $_ } | Sort-Object -CaseSensitive -Unique; @($w.Count) + $w | Set-Content -Encoding utf8NoBOM custom.dic

Příkaz použijte až po ověření, že cíl přijímá neoznačený seznam Hunspell a že soubor custom.dic je nainstalován nebo zaregistrován s příslušným souborem .aff. U exportů z tabulkových procesorů nebo opakovatelných importů je skript PowerShell nebo Python bezpečnější než ruční úpravy, protože filtrování, zpracování duplicit a počty položek zůstávají reprodukovatelné.

Nástroje a kontroly kompatibility

VS Code a Notepad++ jsou vhodné pro kontrolu kódování, konců řádků a syntaxe ukázkového slovníku. PyGlossary dokáže převádět podporované formáty slovníků, ale není obecným řešením pro libovolné soubory TXT nebo proprietární varianty DIC; ověřte, že vybrané vstupní a výstupní pluginy odpovídají přesně cílovému formátu.

Žádný obecný online převodník nedokáže spolehlivě odvodit dialekt DIC. Vyhněte se službám, které slibují univerzální převod z TXT do DIC, zejména u jmen zákazníků, interní terminologie nebo jiné důvěrné slovní zásoby. Online službu pro zpracování textu použijte pouze tehdy, pokud lze její syntaxi výstupu a kódování ověřit podle dokumentace cílové aplikace.

Kódování musí přesně odpovídat cíli. Soubory Hunspell AFF běžně obsahují SET UTF-8; UTF-16, Windows-1252 nebo nepodporovaná značka pořadí bajtů mohou poškodit znaky s diakritikou nebo způsobit selhání prvního záznamu.

Nainstalovaný slovník otestujte běžným slovem, slovem s diakritikou, výrazem psaným velkými písmeny a vlastní položkou. Pokud načtení selže, porovnejte název souboru, první řádek, kódování, konce řádků, umístění instalace a požadované doprovodné soubory se známým funkčním slovníkem.