極鏈科技HPAIC人類蛋白質(zhì)圖譜分類挑戰(zhàn)賽金牌經(jīng)驗(yàn)分享
近期,由Kaggle主辦,Leica Microsystems和NVIDIA贊助的HPAIC(Human Protein Atlas Image Classification)競(jìng)賽正式結(jié)束。比賽為期三個(gè)月,共有來(lái)自全球的2236個(gè)隊(duì)伍參加,極鏈AI研究院與工程院最終獲得挑戰(zhàn)賽金牌。
比賽介紹
蛋白質(zhì)是人體細(xì)胞中的“行動(dòng)者”,執(zhí)行許多共同促進(jìn)生命的功能。蛋白質(zhì)的分類僅限于一種或幾種細(xì)胞類型中的單一模式,但是為了完全理解人類細(xì)胞的復(fù)雜性,模型必須在一系列不同的人類細(xì)胞中對(duì)混合模式進(jìn)行分類。
可視化細(xì)胞中蛋白質(zhì)的圖像通常用于生物醫(yī)學(xué)研究,這些細(xì)胞可以成為下一個(gè)醫(yī)學(xué)突破的關(guān)鍵。然而,由于高通量顯微鏡的進(jìn)步,這些圖像的生成速度遠(yuǎn)遠(yuǎn)超過(guò)人工評(píng)估的速度。因此,對(duì)于自動(dòng)化生物醫(yī)學(xué)圖像分析以加速對(duì)人類細(xì)胞和疾病的理解,需要比以往更大的需求。
雖然這是生物學(xué)方面的競(jìng)賽,但是其本質(zhì)是機(jī)器視覺(jué)方向的圖像多標(biāo)簽分類問(wèn)題,參賽隊(duì)伍也包括許多機(jī)器視覺(jué)和機(jī)器學(xué)習(xí)領(lǐng)域的競(jìng)賽專家。
數(shù)據(jù)分析
官方給我們提供了兩種類型的數(shù)據(jù)集,一部分是512x512的png圖像,一部分是2048x2048或3072x3072的TIFF圖像,數(shù)據(jù)集大概 268G, 其中訓(xùn)練集:31072 x 4張,測(cè)試集:11702 x 4張。
一個(gè)蛋白質(zhì)圖譜由4種染色方式組成(red,green,blue,yellow),圖像示例如下:
我們將4個(gè)通道合并成3通道(RYB)可視化的圖像如下所示:
在本次競(jìng)賽中一共有28個(gè)類別,比如 Nucleoplasm、Nuclear membrane等,每個(gè)圖譜圖像都可以有一個(gè)或者多個(gè)標(biāo)簽。標(biāo)簽數(shù)量統(tǒng)計(jì)如下:
可以發(fā)現(xiàn)標(biāo)簽數(shù)量集中在1-3個(gè),但是仍然會(huì)有圖像有5個(gè)標(biāo)簽,給比賽增加了一定的難度。
另一方面的難點(diǎn)是數(shù)據(jù)集中樣本數(shù)量很不均勻,圖像最多的類別有12885張,而圖像最少的類別只有11張圖像,這給競(jìng)賽造成很大的困難,樣本數(shù)量分布情況可以在圖中看出。
在比賽過(guò)程中逐步有參賽者發(fā)現(xiàn)官方的額外數(shù)據(jù)集HPAv18,并得到官方授權(quán),這些數(shù)據(jù)集有105678張,很大程度的擴(kuò)大了樣本數(shù)量,同時(shí)給我們提供了很大的幫助。
環(huán)境資源
硬件方面我們使用了4塊NVIDIA TESLA P100顯卡,使用pytorch作為我們的模型訓(xùn)練框架。
圖像預(yù)處理
HPAv18 圖像與官方給出的圖像有一定的差別,雖然也是由4中染色方式組成,但是每個(gè)染色圖像是一個(gè)RGB圖像,而不是官方的單通道圖像,而且RGB三個(gè)通道的值差別較大,我們對(duì)這些圖像做了預(yù)處理,對(duì)每個(gè)RGB圖像只取一個(gè)通道(r_out=r,g_out=g,b_out=b,y_out=b),并將這些圖像縮放到512x512和1024x1024兩種尺度。
對(duì)于TIFF文件,我們用了一周的時(shí)間把這個(gè)數(shù)據(jù)集下載下來(lái),然后將所有圖像縮放到1024x1024。
數(shù)據(jù)增廣
我們比賽中使用的增廣方式有Rotation, Flip 和 Shear三種;因?yàn)槲覀儾恢酪粡垐D像中的多個(gè)細(xì)胞之間是否有關(guān)聯(lián)關(guān)系,所以比賽中沒(méi)有使用隨機(jī)裁剪的增廣方式。

發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
最新活動(dòng)更多
-
3月27日立即報(bào)名>> 【工程師系列】汽車電子技術(shù)在線大會(huì)
-
4月30日立即下載>> 【村田汽車】汽車E/E架構(gòu)革新中,新智能座艙挑戰(zhàn)的解決方案
-
5月15-17日立即預(yù)約>> 【線下巡回】2025年STM32峰會(huì)
-
即日-5.15立即報(bào)名>>> 【在線會(huì)議】安森美Hyperlux™ ID系列引領(lǐng)iToF技術(shù)革新
-
5月15日立即下載>> 【白皮書(shū)】精確和高效地表征3000V/20A功率器件應(yīng)用指南
-
5月16日立即參評(píng) >> 【評(píng)選啟動(dòng)】維科杯·OFweek 2025(第十屆)人工智能行業(yè)年度評(píng)選
推薦專題
- 1 UALink規(guī)范發(fā)布:挑戰(zhàn)英偉達(dá)AI統(tǒng)治的開(kāi)始
- 2 北電數(shù)智主辦酒仙橋論壇,探索AI產(chǎn)業(yè)發(fā)展新路徑
- 3 降薪、加班、裁員三重暴擊,“AI四小龍”已折戟兩家
- 4 “AI寒武紀(jì)”爆發(fā)至今,五類新物種登上歷史舞臺(tái)
- 5 國(guó)產(chǎn)智駕迎戰(zhàn)特斯拉FSD,AI含量差幾何?
- 6 光計(jì)算迎來(lái)商業(yè)化突破,但落地仍需時(shí)間
- 7 東陽(yáng)光:2024年扭虧、一季度凈利大增,液冷疊加具身智能打開(kāi)成長(zhǎng)空間
- 8 地平線自動(dòng)駕駛方案解讀
- 9 封殺AI“照騙”,“淘寶們”終于不忍了?
- 10 優(yōu)必選:營(yíng)收大增主靠小件,虧損繼續(xù)又逢關(guān)稅,能否乘機(jī)器人東風(fēng)翻身?