Знающие, помогите рассчитать энтропию трех URL. Мб я путаю определение понятия энтропии... мне нужно вывести какую-либо закономерность и определить схожесть нескольких Friendly URL. Например: 1. http://ru.wikipedia.org/wiki/one-friendly-url 2. http://ru.wikipedia.org/wiki/any-other-friendly-url 3. http://ru.wikipedia.org/else/any-other/url-trololo нужно определить что первые два URL более похожи между собой чем третий
Нужно больше примеров и правильных результатов для них, т.к. в приведенном случае достаточно просто попарно сравнить строки и выбрать те, где первое отличие находится дальше от начала строки.
спс разобрался сравниваю по явным критериям ЧПУ, спецсимволы и % схожести от начала оставшеюся часть привожу в средним арифметическим кодов символов ASCII вышло более-менее красиво первые два - коеф. 82 а третий 100, сойдет
В URL используются символы, это значит что в схожести ссылок играет количество и повторность используемых символов. Я представляю себе алгоритм в виде: 1) Проходим по ссылке и считаем количество каждых символов 2) Разбиваем URL на блоки по разному количеству символов, считаем процент совпадений во всех ссылках 3) Результат получаем исходя из процентного соотношения первого и второго шага.
не понятно что ты под энтропией понимаешь, у 1 и 2 строчки три общих слова (если не считать урл), у 2 и 3 строчки также 3 общих слова, среднеарифметическое кодов символов точно не вариант, тогда получается что строка "az" почти тоже самое, что и "nn" или "by" первое что на ум приходит, посчитать сколько в строке символов a, b, c и тд. и сравнить с аналогичными показателями из другой строки, к примеру взяв сумму разниц по модулю количества соответствующих букв |(a1-a2)|+...+|(Z1-Z2)| чем сумма ближе к нулю, тем более похожи строки
интересно, попробую реализовать UPD.: Нашел рабочее решение по Демерау-Левенштейну, спасибо за помощь!