k47.cz
mastodon twitter RSS
bandcamp explorer 0xDEADBEEF
komentáře článku 

Kosinová podobnost



Text komentáře


juzna.cz (2012-12-12 11:18)
Pochopil jsem to spravne, ze jsi pri analyze kontroloval vsechny kombinace, tedy n^2 porovnani (kde n je pocet dokumentu)? Jak dlouho to trvalo?

Pri vetsim mnozstvi dat se asi hodilo vytvorit nejaky index, ale to u tento techniky asi moc nepujde, co? Skoda


kaja47 (2012-12-14 02:03)
Přesně tak, bylo to n^2 a vymklo se to z rukou velice rychle a právě proto jsem celý algoritmus dost těžce optimalizoval (cache locality a branch prediction překvapivě hrály velkou roli). Ale myslím, že celých 12250 * 12250 / 2 kombinací se zpracovávalo v řádu desítek minut.

Kosinová podobnost je jenom (celkem primitivní) míra podobnosti, která může být použita v komplikovanějších schématech, které můžou zahrnovat redukci dimenzionality a clusterování.


Mat (2015-12-09 22:00)
Jednoducho napísané a pochopiteľné, vďaka


píše k47, ascii@k47.cz