> 自媒体 > (AI)人工智能 > 首个千亿生物医药ChatGPT!清华AIR聂再清:行业未来的超级应用
首个千亿生物医药ChatGPT!清华AIR聂再清:行业未来的超级应用
来源:量子位
2023-09-28 14:48:40
740
管理

萧箫 发自 凹非寺量子位 | 公众号 QBItAI

制药行业的“专家版ChatGPT”,终于来了!

就在这两天,首个生物医药的千亿参数大模型产品ChatDD发布,不仅制药各阶段知识“样样通”,还能和药学专家进行对话,瞬间秒懂一些行业神秘“黑话”。

此外,也不用担心问答内容超出ChatDD训练数据截止日期,毕竟它还学会了自己联网、或是从数据库中查找答案。

与同行AI不同的是,ChatDD的“业务范围”,涵盖了制药的前、中、后期三个阶段。

此前的医药行业AI,即使是大模型,往往也只能用于制药的部分阶段,例如前期的药物发现,或是中期的临床前研究。占研发成本大部头的后期临床试验,几乎无人问津。

而ChatDD不仅能参与药物发现、立项、商业智能(BI,Business Inteligence)、临床试验各环节,还能帮助提升成功率。

聂再清介绍表示,ChatDD用于后期临床试验设计,也是大伙儿最期待的功能。

首先,药物在临床试验阶段的通过率,往往并不高。

尤其二期到三期临床,通过率只有34%,三期到四期通过率也不高。但临床试验加上前中期的费用往往又极高,一旦不通过,就是几亿美元成本“打水漂”。

其次,药物通过率不高的原因,(除非药物本身不行)很大程度上是因为没找到适合“对症下药”的患者。

药厂通常会从临床信息数据库中,筛选适合用药的病人。

假设这个药物对数据库中5%的患者有效,那么从这5%的患者中挑选进行临床试验,肯定比剩下95%的患者有效率高。

在综合各方面信息做判断这件事上,ChatDD往往比人类更适合筛选出“对症下药”的患者。

聂再清特意举了一个例子,来表明ChatDD的能力:

注意这里未来会是“私有化部署的合作伙伴的单细胞RNA测序数据”,现在因为没有,所以我们用了水木分子收集到的公开数据计算出来的。

这样的ChatDD,背后功能究竟是怎么实现的?

医学院博士后负责数据构建

ChatDD背后的底座,取名ChatDD-FM,参数量达到千亿级别。

这次推出的ChatDD-FM-100B,是全球首个千亿参数多模态生物医药对话大模型,其在C- Eval评测中达到全部医学4项专业第一、也是唯一平均分超过90分的模型。

联想到团队前不久发的BioMedGPT-10B,其自然语言模态的大模型同样基于LLaMA 2架构,这二者是否有什么联系?

聂再清表示,ChatDD-FM和BioMedGPT,在受众和用途上都不太一样,“有点像ChatGPT和GPT-3.5的区别,前者在对话和意图对齐能力上有更大提升”。

BioMedGPT主要用于科研领域,更擅长英文生物医药科研任务,适合直接拿来作为生物医药领域的相关科研任务的基础模型。

ChatDD-FM主要给国内医药行业“打辅助”,侧重中文对话能力,融入了更多专家的对话模式和经验。

技术上,ChatDD-FM相比BioMedGPT,主要增强了三大方面,模态、训练数据和参数量级——

模态上,增加了蛋白质结构数据;训练上,增加了用于中文、专家对话和调用工具能力的数据;参数量级上,从百亿增加到千亿。

让ChatDD-FM提升“专业度”、说话像“行内人”的秘诀,依旧在于高质量数据上。

这些数据主要分为两部分。

第一部分,是预训练用的医药知识数据,主要目的是让ChatDD-FM提升专业素养,几个月内掌握行业知识。

“对制药行业有划时代意义”

ChatDD背后的公司水木分子,目前已完成千万级种子轮融资。

水木分子自定义为“大模型时代的CRO公司”,即利用大模型或AI技术,帮助别人更好更快地制药。

公司的盈利方式目前有三种,包括ToB付费会员(按使用次数收费)、私有化部署和制药分成。

已经有制药厂商找来合作了——复星医药计划对ChatDD进行私有化部署,用于辅助药物立项等阶段。

药物立项,涉及大量资料查找和判断,包括查找有无药物相关(官能团、分子结构保护等)专利,还要根据大量文献和实时市场信息等资料判断是否值得立项。ChatDD能通过整合文献和相关专利,生成一个完整的参考报告。

ChatDD的出现,聂再清认为对于行业而言有跨时代意义:

它真正将专家的经验和直觉、以及大模型的“智力涌现”能力融会贯通了起来。

此前,制药行业经历了三个阶段,分别是TMDD(Traditional Manual Drug Design)、CADD(Computer-Aided Drug Design)和AIDD(AI Drug Design)。

但无论是人工试验,还是计算或AI辅助药物研发设计,都需要大量人力去“学会如何使用”模型,尚未出现一个能和科研人员直接对话的系统。

现在,ChatDD的出现真正改变了这一现状。

它不仅能将制药的知识经验集成到大模型中,通过提示词就能激发调用出来,还能通过学习专家对话方法掌握专业沟通能力,“相当于把人和机器最powerful的地方做了个融合。”

不过,要完全实现ChatDD的全部潜能,真正进入比较成熟的阶段,聂再清认为至少还有10年的黄金时代。

一方面,对于生物医药行业来说,人类对于蛋白质、细胞、小分子之类的理解也还远远不够,在这个学科方面仍然可以做出很多成绩和进展;

另一方面,对AI行业来说,无论是数据还是算法,也都还没发展到足够成熟的阶段。

数据上,目前生物医药领域内各模态和自然语言对齐的数据还很少。

(就像图文一样,虽然文字和图像各自的数据很多,但图文对齐如VQA的数据却相对要少很多)

对此依旧需要不断收集整理出PQA(蛋白质问答)、MQA(小分子问答)等模态的数据,来让多模态大模型的效果变得更好。

模型上,大模型目前的效果还不是最好的,无论是单模态还是多模态,都值得继续去探索。

所以,公司的下一步计划,就是继续优化模型、增加更多模态,并找到更多的场景落地需求。

对于ChatDD最终形态的设想,聂再清表示:

它会成为一个各模态(大小分子、蛋白质结构、DNA、单细胞等)和自然语言全部对齐的生物医药基础大模型产品。

他也在发布会上预言,这个产品会成为生物医药行业的大模型“Killer APP”。

到那时候,才会真正打破医药界的“双十定律”,高性价比的实现人机协作新药研发。

— 完 —

量子位 QbitAI · 头条号签约

关注我们,第一时间获知前沿科技动态

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
《飞驰人生》片尾为何谢王思聪?不止借车库,千万跑车全是真家伙..
提起《飞驰人生》,不少人都记得片尾字幕里王思聪的名字,却鲜少有人知道..
中国古代的顶级“超跑”,如今全球仅剩六千匹!汗血宝马是啥样?..
在历史的长河中,骏马总是与英雄、战争和传奇紧密相连,而对于我们中国人..
法拉利296 Challenge Stradale路试曝光:赛道版公路跑车即将到来..
【网通社快报】法拉利被拍到正在测试一款重度伪装的原型车,外观酷似赛道..
10款你应该现在就入手的跑车,趁它们还没成为经典款!..
整备质量马力扭矩布局2195磅138马力126磅英尺中置引擎,后轮驱动MR-S 是..
消息称保时捷下月推911 GT3 Cabriolet敞篷跑车:折叠软顶..
IT之家 2 月 24 日消息,汽车媒体 thesupercarblog 于 2 月 22 日发布博..
新能源汽车出海2.0:从“卖车”到“建生态”
文 | 惊蛰研究所,作者|芒种2007年,华语女子团体S.H.E的一首《中国话》..
汽车能“乘火车”返乡了!订单火爆→
今年春运,“12306托运汽车订单火爆”的话题冲上热搜。汽车“坐”着火车..
湖北造飞行汽车来了!单价或50万元以内,市民可以像开汽车一样开“飞车”..
极目新闻记者 黄忠 陈倩 杨绍杭 王俐燃 刘中灿像车,又像飞机,能垂直起..
紧急召回!近30万辆汽车,吉林车主快自查!
国家市场监督管理总局网站2月9日发布上海蔚来汽车有限公司的汽车召回信息..
关于作者
婆罗花开(普通会员)
文章
1882
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体103523

0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索