Přesně tak, bylo to n^2 a vymklo se to z rukou velice rychle a právě proto jsem celý algoritmus dost těžce optimalizoval (cache locality a branch prediction překvapivě hrály velkou roli). Ale myslím, že celých 12250 * 12250 / 2 kombinací se zpracovávalo v řádu desítek minut.
Kosinová podobnost je jenom (celkem primitivní) míra podobnosti, která může být použita v komplikovanějších schématech, které můžou zahrnovat redukci dimenzionality a clusterování.
Pri vetsim mnozstvi dat se asi hodilo vytvorit nejaky index, ale to u tento techniky asi moc nepujde, co? Skoda