facebook LinkedIN LinkedIN - follow
Aktuality -> Podnikové aplikace a služby - 13. 9. 2024 - redakce

Nová verze modulu ATM pro zpracování nestrukturovaných textových dat

Společnost ACREA CR vydala novou verzi textminingového modulu ATM, který je doplňkem univerzálního softwaru SPSS Modeler pro datové vědce. Modul ATM rozšiřuje možnosti SPSS Modeleru o zpracování nestrukturovaných textových dat. ATM nabízí především prostředky pro analýzu textových dokumentů. Umožňuje také zpracovávat a kombinovat strukturovaná databázová data a volné texty. Nabízí pestrou škálu procedur pro datové manipulace při přípravě strukturované kolekce textových dokumentů.



S uzly modulu ATM se pracuje stejně jako s nativními uzly SPSS Modeler. Celý analytický postup se zaznamenává jako diagram (proud), v němž si jednotlivé uzly předávají data. Nová verze ATM 3.0 přináší vylepšení stávajících uzlů a také nabízí dva nové výstupní uzly: náhled na kolekci dokumentů ve formě interaktivních snippetů a obrázek četných termínů známý pod názvem oblak slov. V jazykově závislých uzlech pro extrakci termínů, pojmenovaných entit a klasifikaci sentimentu přibyla možnost zpracovávat multijazyčné kolekce s omezeným výběrem jazyků. V uzlu pro extrakci termínů má uživatel možnost volit množství relevantních termínů extrahovaných z každého dokumentu. Při hledání pojmenovaných entit se můžeme omezit pouze na hledání osob, organizací a lokalit nebo hledat i obecnější entity jako jsou události či produkty. Sestavování regulárních výrazů je opět snazší díky vylepšené grafické kalkulačce pro vkládání zástupných symbolů. A nakonec výčtu vybraných nových funkcí jmenujme rozšířený výběr editačních vzdáleností pro porovnávání podobnosti dvou textů.

Acrea

Vylepšení se nevyhnula ani algoritmům v pozadí jednotlivých uzlů. Paralelní a dávkové výpočty u jazykově závislých uzlů jsou nyní standardně podporovány a uživatel nemusí volit jejich parametry, neboť se automaticky nastaví tak, aby zpracování proběhlo co nejrychleji. Optimalizováno bylo i vyhledávání pomocí regulárních výrazů.

Nový textminingový modul ATM 3.0 nabízí uživatelům SPSS Modeler komfortní prostředí pro práci s českými a slovenskými texty. Uživatelé mohou nejen analyzovat obsah dokumentů pomocí extrakce klíčových termínů a pojmenovaných entit, ale především díky integraci s SPSS Modeler, mohou textové dokumenty převést na datovou tabulku a dále pomocí strojově učených modelů řešit textminingové klasifikační, vyhledávací a segmentační úlohy jako například třídění pošty, analýzu stížností nebo identifikaci autora.
 


 
  

- PR -

Teva Czech Industries vstupuje do nové éry

v oblasti digitalizace výroby, chce být nejlepším závodem v korporaci a k tomu potřebuje spolehlivé partnery říká generální ředitel Radovan Toman


Radovan TomanHlavními trendy inovačních pro­ce­sů jsou Průmysl 4.0 a Digitální továrna. Digitalizace výroby umožňuje zlepšení efektivity, flexibility a zvýšení kon­ku­ren­ce­schop­nos­ti výrobních podniků. Spolehlivý partner a technická podpora jsou proto klíčovými faktory pro úspěšnou automatizaci a digitalizaci výroby.

  

- PR -

Tři otázky pro Ondřeje Šťáhlavského

Ondřej ŠťáhlavskýRegionálního ředitele společnosti Fortinet pro střední a východní Evropu jsme se zeptali na blížící se kyberbezpečnostní konferenci Fortinet Security Day, která se uskuteční 7. října v Praze.