Nová verze modulu ATM pro zpracování nestrukturovaných textových dat

Společnost ACREA CR vydala novou verzi textminingového modulu ATM, který je doplňkem univerzálního softwaru SPSS Modeler pro datové vědce. Modul ATM rozšiřuje možnosti SPSS Modeleru o zpracování nestrukturovaných textových dat. ATM nabízí především prostředky pro analýzu textových dokumentů. Umožňuje také zpracovávat a kombinovat strukturovaná databázová data a volné texty. Nabízí pestrou škálu procedur pro datové manipulace při přípravě strukturované kolekce textových dokumentů.



S uzly modulu ATM se pracuje stejně jako s nativními uzly SPSS Modeler. Celý analytický postup se zaznamenává jako diagram (proud), v němž si jednotlivé uzly předávají data. Nová verze ATM 3.0 přináší vylepšení stávajících uzlů a také nabízí dva nové výstupní uzly: náhled na kolekci dokumentů ve formě interaktivních snippetů a obrázek četných termínů známý pod názvem oblak slov. V jazykově závislých uzlech pro extrakci termínů, pojmenovaných entit a klasifikaci sentimentu přibyla možnost zpracovávat multijazyčné kolekce s omezeným výběrem jazyků. V uzlu pro extrakci termínů má uživatel možnost volit množství relevantních termínů extrahovaných z každého dokumentu. Při hledání pojmenovaných entit se můžeme omezit pouze na hledání osob, organizací a lokalit nebo hledat i obecnější entity jako jsou události či produkty. Sestavování regulárních výrazů je opět snazší díky vylepšené grafické kalkulačce pro vkládání zástupných symbolů. A nakonec výčtu vybraných nových funkcí jmenujme rozšířený výběr editačních vzdáleností pro porovnávání podobnosti dvou textů.

Acrea

Vylepšení se nevyhnula ani algoritmům v pozadí jednotlivých uzlů. Paralelní a dávkové výpočty u jazykově závislých uzlů jsou nyní standardně podporovány a uživatel nemusí volit jejich parametry, neboť se automaticky nastaví tak, aby zpracování proběhlo co nejrychleji. Optimalizováno bylo i vyhledávání pomocí regulárních výrazů.

Nový textminingový modul ATM 3.0 nabízí uživatelům SPSS Modeler komfortní prostředí pro práci s českými a slovenskými texty. Uživatelé mohou nejen analyzovat obsah dokumentů pomocí extrakce klíčových termínů a pojmenovaných entit, ale především díky integraci s SPSS Modeler, mohou textové dokumenty převést na datovou tabulku a dále pomocí strojově učených modelů řešit textminingové klasifikační, vyhledávací a segmentační úlohy jako například třídění pošty, analýzu stížností nebo identifikaci autora.
 


 
  

- PR -

Spolehlivá kontrola kvality bez vysokých nákladů

Main_KV_first_image___k___vodu-PR.jpgPokud pracujete ve výrobním provozu nebo řídíte inženýrské operace, jistě znáte typické současné výzvy: přísnější tolerance, kratší dodací lhůty a stále složitější díly. Jenže kontrola jakosti už tomuto tempu mnohdy nestačí. Ruční nástroje, zastaralé 3D skenery a pracovní postupy závislé na zkušených operátorech brzdí produktivitu a rozvoj v průmyslu.

  

- PR -

AI jako motor výroby a datové inteligence

ITS_6Jak jste si jistě všimli, aktuální vydání IT Systems je první, které má nové logo. Po dlouhé době jsme se rozhodli oživit nejen logo časopisu, ale také navazujících online médií. Právě výraznější provázání loga časopisu IT Systems, webu SystemOnLine a newsletteru SystemNEWS bylo hlavním cílem modernizace, ke které jsme přistoupili teprve podruhé v téměř třicetileté historii našeho časopisu.