码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • 机器学习实战六步法之数据收集方法(四)


    👍【AI机器学习入门与实战】目录
    🍭基础篇
    🔥 第一篇:【AI机器学习入门与实战】AI 人工智能介绍
    🔥 第二篇:【AI机器学习入门与实战】机器学习核心概念理解
    🔥 第三篇:【AI机器学习入门与实战】机器学习算法都有哪些分类?
    🔥 第四篇:【AI机器学习入门与实战】数据从何而来?
    🔥 第五篇:【AI机器学习入门与实战】数据预处理的招式:闪电五连鞭!
    🔥 第六篇:【AI机器学习入门与实战】选择合适的算法:选择比努力重要!
    🔥 第七篇:【AI机器学习入门与实战】训练模型、优化模型、部署模型
    🍭实战篇
    🔥 第八篇:【AI机器学习入门与实战】用户RFM模型聚类分层实战
    🔥 第九篇:【AI机器学习入门与实战】使用OpenCV识别滑动验证码案例
    🔥 第十篇:【AI机器学习入门与实战】CNN卷积神经网络识别图片验证码案例
    未完待续…

    要落地一个机器学习的项目,是有章可循的,通过这六个步骤,小白也能搞定机器学习。

    看我闪电六连鞭!🤣

    [外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-8fokt0Mq-1686313603676)(image/image-20230604123237459.png)]

    数据收集

    数据是机器学习的基础,没有数据一切都是空谈!数据集的数据量和数据的质量往往决定了“事情的成败”。所以现在国内(比如百度的文言一心)搞大模型的公司,他们往往拥有“庞大的”数据资产。

    数据到底从何而来?

    数据的收集通常是比较费力的工作!我们通常通过开源的数据集、数据埋点、数据爬取来获取数据集。

    [外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-juDDEbbZ-1686313671457)(image/image-20230608210425924.png)]

    下面介绍一些开源的数据集:

    1. Kaggle:这是一个知名的数据科学社区,提供了大量的免费开源数据集,涵盖了多个领域和任务。网站地址:https://www.kaggle.com/datasets

    2. UCI机器学习数据仓库:这是一个包含多个数据集的数据仓库,涵盖了多个领域和任务,如计算机科学、医学、金融等。网站地址:https://archive.ics.uci.edu/ml/index.php

    3. Google Dataset Search:这是一个由Google提供的免费开源数据集搜索引擎,可用于搜索各种数据集,如图像、文本、音频等。网站地址:https://datasetsearch.research.google.com/

    4. AWS数据集:这是由亚马逊AWS提供的免费开源数据集,包括天气数据、气象数据、医学数据等,可用于机器学习和数据科学。网站地址:https://registry.opendata.aws/

    5. OpenML:这是一个由欧洲机器学习研究中心提供的免费开源数据集平台,包括多个数据集和任务,可用于机器学习和数据挖掘。网站地址:https://www.openml.org/

    6. Data.gov:这是由美国政府提供的免费开源数据集平台,包括各种政府数据和公共数据,可用于统计分析和数据科学。网站地址:https://www.data.gov/

    以下是一些医药行业的开源数据集

    1. DrugBank:这是一个包含药物化合物、药品剂量、药理学数据等的数据库,用于药物研究和开发。网站地址:https://www.drugbank.ca/

    2. PubChem:这是一个包含化学物质、化合物、生物分子等的数据库,用于生物化学和药物研究。网站地址:https://pubchem.ncbi.nlm.nih.gov/

    3. TCGA:这是一个包含多种癌症数据的数据库,包括基因表达、突变、临床信息等,用于癌症研究和治疗。网站地址:https://www.cancer.gov/about-nci/organization/ccg/research/structural-genomics/tcga

    4. GTEX:这是一个包含多个组织和器官的基因表达数据集,用于研究人类基因表达的变化和差异。网站地址:https://www.gtexportal.org/home/

    5. MIMIC:这是一个包含多个重症监护患者的临床数据集,包括生理信号、诊断数据、药物治疗数据等,用于疾病预测和治疗。网站地址:https://mimic.mit.edu/

    6. PhysioNet:这是一个包含多个生理信号数据集的数据库,包括心电图、脑电图、呼吸信号等,用于生理信号分析和诊断。网站地址:https://physionet.org/


    🎉 如果喜欢这篇文章,点赞👍 收藏⭐ 关注 ✅ 哦,创作不易,感谢!😀

    请添加图片描述

  • 相关阅读:
    Haskell 的 IO
    强化学习和近似动态规划的区别与联系是什么,他们俩是一回事吗
    GitLab CI/CD的原理及应用详解(三)
    常用矩阵求导公式速查
    ESP32 485温湿压、噪声4合1传感器测试
    postman高阶脚本
    ESP32 Arduino引脚分配参考:您应该使用哪些 GPIO 引脚?
    java后端如何做数据校验 JSR303校验 分组校验 自定义校验
    SOAP WebService 发布服务成功,但是访问404
    Leetcode24-两两交换链表中的节点详解
  • 原文地址:https://blog.csdn.net/rongtaoup/article/details/131134440
  • 最新文章
  • 攻防演习之三天拿下官网站群
    数据安全治理学习——前期安全规划和安全管理体系建设
    企业安全 | 企业内一次钓鱼演练准备过程
    内网渗透测试 | Kerberos协议及其部分攻击手法
    0day的产生 | 不懂代码的"代码审计"
    安装scrcpy-client模块av模块异常,环境问题解决方案
    leetcode hot100【LeetCode 279. 完全平方数】java实现
    OpenWrt下安装Mosquitto
    AnatoMask论文汇总
    【AI日记】24.11.01 LangChain、openai api和github copilot
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1
正则表达式工具 cron表达式工具 密码生成工具

京公网安备 11010502049817号