[機統] 兩筆二維資料相似程度
請問一下,兩坨二維資料集A,B
A = {(x_1,y_1),(x_2,y_2),...,(x_n,y_n)}
B = {(c_1,d_1),(c_2,d_2),...,(c_n,d_n)}
若已知平均數 m_x=m_c ,m_y=m_d
變異數 s_x=s_c_,s_y=s_d
共變異數 s_(xy)=s_(cd)
(或是再加入一些條件,例如限制最大區域)
則A,B這兩個資料集會"很像"嗎
目前我自己沒有確切敘述去刻劃"很像",不過其他替代方案,比如KL-散度(看密度)
但我想要的"很像"比較像是【兩者同時都會是由左下到右上的斜線 or 同為很散佈的圓】
這種幾何圖形與分布上的很像
不是統計出身,沒啥sense QQ
目前有三個猜測:
(1) 很難刻劃【兩者同時是某個圖形散佈】的數學定義
(2) 存在A,B滿足那些統計量都一樣,但是分布截然不同
(3) 即便有若【A,B滿足那些統計量都一樣】 則 【兩者同時是某個圖形散佈】
但是以電腦訓練的角度而言,很難讓程式自己把B的統計量修成跟A一樣
(造machine learning 造 loss function)
請指教,謝謝!
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 220.128.169.29
※ 文章網址: https://www.ptt.cc/bbs/Math/M.1522750536.A.6D8.html
※ 編輯: znmkhxrw (220.128.169.29), 04/03/2018 18:15:47
→
04/03 18:21,
8年前
, 1F
04/03 18:21, 1F
推
04/03 18:47,
8年前
, 2F
04/03 18:47, 2F
→
04/03 18:48,
8年前
, 3F
04/03 18:48, 3F
→
04/03 18:49,
8年前
, 4F
04/03 18:49, 4F
→
04/03 18:51,
8年前
, 5F
04/03 18:51, 5F
→
04/03 18:52,
8年前
, 6F
04/03 18:52, 6F
推
04/03 21:34,
8年前
, 7F
04/03 21:34, 7F
→
04/03 21:34,
8年前
, 8F
04/03 21:34, 8F
→
04/03 21:37,
8年前
, 9F
04/03 21:37, 9F
→
04/03 21:37,
8年前
, 10F
04/03 21:37, 10F
→
04/03 21:41,
8年前
, 11F
04/03 21:41, 11F
→
04/03 21:41,
8年前
, 12F
04/03 21:41, 12F
→
04/03 21:41,
8年前
, 13F
04/03 21:41, 13F
推
04/03 22:48,
8年前
, 14F
04/03 22:48, 14F
→
04/03 22:48,
8年前
, 15F
04/03 22:48, 15F
→
04/05 00:48,
8年前
, 16F
04/05 00:48, 16F
→
04/07 11:28,
8年前
, 17F
04/07 11:28, 17F
→
04/07 11:30,
8年前
, 18F
04/07 11:30, 18F
→
04/07 11:32,
8年前
, 19F
04/07 11:32, 19F
→
04/07 11:33,
8年前
, 20F
04/07 11:33, 20F
→
04/07 11:35,
8年前
, 21F
04/07 11:35, 21F
→
04/07 11:37,
8年前
, 22F
04/07 11:37, 22F
→
04/07 11:38,
8年前
, 23F
04/07 11:38, 23F