本文實例講述了Java基于余弦方法實現的計算相似度算法。分享給大家供大家參考,具體如下:
(1)余弦相似性
通過測量兩個向量之間的角的余弦值來度量它們之間的相似性。0度角的余弦值是1,而其他任何角度的余弦值都不大于1;并且其最小值是-1。從而兩個向量之間的角度的余弦值確定兩個向量是否大致指向相同的方向。所以,它通常用于文件比較。
相關介紹可參考百度百科:余弦相似性
(2)算法實現的中未使用權重(IDF ---逆文檔頻率),使用詞項的出現次數作為向量空間的值。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
|
import java.util.HashMap; import java.util.Iterator; import java.util.Map; public class SimilarDegreeByCos { /* * 計算兩個字符串(英文字符)的相似度,簡單的余弦計算,未添權重 */ public static double getSimilarDegree(String str1, String str2) { //創建向量空間模型,使用map實現,主鍵為詞項,值為長度為2的數組,存放著對應詞項在字符串中的出現次數 Map<String, int[]> vectorSpace = new HashMap<String, int[]>(); int[] itemCountArray = null;//為了避免頻繁產生局部變量,所以將itemCountArray聲明在此 //以空格為分隔符,分解字符串 String strArray[] = str1.split(" "); for(int i=0; i<strArray.length; ++i) { if(vectorSpace.containsKey(strArray[i])) ++(vectorSpace.get(strArray[i])[0]); else { itemCountArray = new int[2]; itemCountArray[0] = 1; itemCountArray[1] = 0; vectorSpace.put(strArray[i], itemCountArray); } } strArray = str2.split(" "); for(int i=0; i<strArray.length; ++i) { if(vectorSpace.containsKey(strArray[i])) ++(vectorSpace.get(strArray[i])[1]); else { itemCountArray = new int[2]; itemCountArray[0] = 0; itemCountArray[1] = 1; vectorSpace.put(strArray[i], itemCountArray); } } //計算相似度 double vector1Modulo = 0.00;//向量1的模 double vector2Modulo = 0.00;//向量2的模 double vectorProduct = 0.00; //向量積 Iterator iter = vectorSpace.entrySet().iterator(); while(iter.hasNext()) { Map.Entry entry = (Map.Entry)iter.next(); itemCountArray = (int[])entry.getValue(); vector1Modulo += itemCountArray[0]*itemCountArray[0]; vector2Modulo += itemCountArray[1]*itemCountArray[1]; vectorProduct += itemCountArray[0]*itemCountArray[1]; } vector1Modulo = Math.sqrt(vector1Modulo); vector2Modulo = Math.sqrt(vector2Modulo); //返回相似度 return (vectorProduct/(vector1Modulo*vector2Modulo)); } /* * */ public static void main(String args[]) { String str1 = "gold silver truck" ; String str2 = "Shipment of gold damaged in a fire" ; String str3 = "Delivery of silver arrived in a silver truck" ; String str4 = "Shipment of gold arrived in a truck" ; String str5 = "gold gold gold gold gold gold" ; System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str2)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str3)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str4)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str5)); } } |
希望本文所述對大家java程序設計有所幫助。