Nová verze modulu ATM pro zpracování nestrukturovaných textových dat

Společnost ACREA CR vydala novou verzi textminingového modulu ATM, který je doplňkem univerzálního softwaru SPSS Modeler pro datové vědce. Modul ATM rozšiřuje možnosti SPSS Modeleru o zpracování nestrukturovaných textových dat. ATM nabízí především prostředky pro analýzu textových dokumentů. Umožňuje také zpracovávat a kombinovat strukturovaná databázová data a volné texty. Nabízí pestrou škálu procedur pro datové manipulace při přípravě strukturované kolekce textových dokumentů.



S uzly modulu ATM se pracuje stejně jako s nativními uzly SPSS Modeler. Celý analytický postup se zaznamenává jako diagram (proud), v němž si jednotlivé uzly předávají data. Nová verze ATM 3.0 přináší vylepšení stávajících uzlů a také nabízí dva nové výstupní uzly: náhled na kolekci dokumentů ve formě interaktivních snippetů a obrázek četných termínů známý pod názvem oblak slov. V jazykově závislých uzlech pro extrakci termínů, pojmenovaných entit a klasifikaci sentimentu přibyla možnost zpracovávat multijazyčné kolekce s omezeným výběrem jazyků. V uzlu pro extrakci termínů má uživatel možnost volit množství relevantních termínů extrahovaných z každého dokumentu. Při hledání pojmenovaných entit se můžeme omezit pouze na hledání osob, organizací a lokalit nebo hledat i obecnější entity jako jsou události či produkty. Sestavování regulárních výrazů je opět snazší díky vylepšené grafické kalkulačce pro vkládání zástupných symbolů. A nakonec výčtu vybraných nových funkcí jmenujme rozšířený výběr editačních vzdáleností pro porovnávání podobnosti dvou textů.

Acrea

Vylepšení se nevyhnula ani algoritmům v pozadí jednotlivých uzlů. Paralelní a dávkové výpočty u jazykově závislých uzlů jsou nyní standardně podporovány a uživatel nemusí volit jejich parametry, neboť se automaticky nastaví tak, aby zpracování proběhlo co nejrychleji. Optimalizováno bylo i vyhledávání pomocí regulárních výrazů.

Nový textminingový modul ATM 3.0 nabízí uživatelům SPSS Modeler komfortní prostředí pro práci s českými a slovenskými texty. Uživatelé mohou nejen analyzovat obsah dokumentů pomocí extrakce klíčových termínů a pojmenovaných entit, ale především díky integraci s SPSS Modeler, mohou textové dokumenty převést na datovou tabulku a dále pomocí strojově učených modelů řešit textminingové klasifikační, vyhledávací a segmentační úlohy jako například třídění pošty, analýzu stížností nebo identifikaci autora.
 


 
  

- PR -

Informační systém MoNET

Moderní GIS jako klíč k efektivní správě vodárenské infrastruktury pro města a obce


Vodárenská infrastruktura patří k systémům, u nichž se význam kvalitních dat a jejich dostupnosti naplno projeví až ve chvíli, kdy je potřeba rychle řešit konkrétní provozní situaci. Evidence vodovodních a kanalizačních sítí, jejich technických prvků, tlakových a monitorovacích zón, hydrantů, výustních objektů nebo vztahů k okolním pozemkům vytváří rozsáhlý datový celek, který už dnes není možné efektivně spravovat pouze pomocí tabulek, dokumentů a izolovaných aplikací. Moderní vodárenská organizace potřebuje mít informace o své infrastruktuře propojené, aktuální a dostupné lidem, kteří s nimi pracují v kanceláři i přímo v terénu.