更多>>关于我们

西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。

您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。

数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。

更多>>官方微博

西安鲲之鹏
陕西 西安

加关注

  • 【经验分享】com.google.gson.Gson的toJson()方法在插桩分析的时候太有用了,赞赞赞。
    function toJson(javaObject) {
        return Java.use("com.google.gson.Gson").$new().toJson(javaObject);
    };
    通过toJson(javaObject)可以将Java对象(数据结构)转换成JSON格式,非常方便。想想之前都是通过字符串拼接各个字段(熟悉)值,太费劲儿了。

    关于com.google.gson.Gson的toJson()的更多示例可以看这篇文章:https://www.cnblogs.com/reboost/p/9521603.html
    发布时间:2021-06-04 10:57:34
  • 【经验分享】某美丽修行APP反采集策略分析
    采用的反采集策略:
    (1)加了360的壳。
    (2)ssl证书固定。
    (3)部分接口返回的数据有加密,例如附图1所示。
    (4)商品搜索部分需要登录(不登录实际可以拿到前10条数据)。

    解决方案:
    (1)通过frida脚本绕过证书固定,成功拦截到交互过程,如附图1所示,为某个请求的应答。
    (2)经过dump内存dex文件,jadx反编译,找到了“entityInfo”加密串的解密过程,如图2所示。顺藤摸瓜,找到AES解密的key和iv在so文件里,如图3所示。
    (3)用ida pro静态分析so文件,成功找到了key和iv,如图4所示。
    (4)用获取到的key和iv尝试解密“entityInfo”,成功,如图5所示。

    "商品详情"对应JSON数据如附图6所示,"全成分表"对应JSON数据如附图7-9所示。
    发布时间:2021-06-03 14:41:55
  • 【经验分享】一例网站反爬机制分析
    某网站,网址:http://t.cn/Rm6yxny(microchip官网)。浏览器访问正常,用Python urllib2和curl命令获取超时,修改成浏览器相同UA也同样结果。

    根据经验,网站是根据“是否使用了长连接”来识别爬虫的。现代浏览器默认都会使用长连接(Connection: keep-alive)来提高多个请求的效率,而urllib2默认不使用长连接,每次请求完毕都会关闭tcp连接,urllib2发出的HTTP请求Connection值都为close(urllib2源码里写死了,如附图所示)。

    解决方法:使用支持长连接的HTTP库即可,例如requests库或者urllib3库。

    另外,我在stackoverflow上看到了能让urllib2支持keep-alive的方法,连接在这里https://stackoverflow.com/questions/1037406/python-urllib2-with-keep-alive,没有测试过。
    发布时间:2021-05-28 11:25:15
  • 【经验分享】如何在命令行下执行单个SQL语句?
    例如 定期清理django_session表
    示例: mysql -u root -p 123456 somedb -e "delete from django_session" ​​​​
    发布时间:2021-05-27 17:05:36
  • 【经验分享】某http proxy server远程连接老被reset,如图所示,curl连接总是返回“ Connection reset by peer”,偶尔也能成功一下。nc连接,能连上,但连上后马上断开。
    在服务器上本地测试就没问题。刚开始怀疑是机房防火墙搞的怪,联系IDC无果。

    proxy server用的是delegate,看命令行参数,偶然发现有个"MAXIMA=conpch:30"参数,突然意识到了问题,应该是并发数设置太小了。改成200,重启delegate,问题解决。

    附“MAXIMA conpch”参数说明文档:
    http://t.cn/A6c5ngHp
    conpch  --- max. number of connections at a time per client host [unlimited]
    发布时间:2021-04-08 10:37:42
  • 【经验分享】使用httping来测试http/socks5 proxy的稳定性

    httping是一款http连通性测试工具,通过跟踪持续http请求的结果,来评估目标平台的稳定性。它支持http/https以及socks5代理,因此我们可以借以测试http/https/socks5代理的稳定性。

    示例1:
    测试http代理的稳定性,命令如下:
    httping --proxy 代理IP:代理端口 --proxy-user  代理用户名 --proxy-password  代理密码 -Y 目标网址
    效果如图1和图2所示。通过对比可以明细看出图2的代理要比图1的速度快很多,而且稳定性更好。

    示例2:
    测试socks5代理的稳定性,命令如下:
    httping -5 --proxy 代理IP:代理端口 --proxy-user  代理用户名 --proxy-password  代理密码  -Y 目标网址
    PS:与设置http代理相比,设置socks5代理只多了一个"-5"参数。
    效果如图3所示。

    httpping项目主页:http://t.cn/RqDnaQc,上面还有编译好的win64版本。
    发布时间:2021-03-26 12:23:58
  • 【经验分享】mysql修改数据存储目录datadir之后,无法正常启动。syslog显示错误信息如下:
    apparmor="DENIED" operation="open" profile="/usr/sbin/mysqld" name="/data/sdi/mysql_data/mysql/ibdata1"
    有很多类似行,见图1,跟文件权限有关。

    apparmor 是一款Linux下的应用程序权限控制软件,这里是它禁止了mysqld进程对新的数据库目录的访问。

    解决方案:
    (1)编辑apparmor的mysql进程权限配置文件etc/apparmor.d/usr.sbin.mysqld,加入对新的数据库目录的访问授权。
    (2)重启apparmor服务,sudo service apparmor restart,这一步很重要,光修改上述配置文件不行,重启才能生效。
    (3)重启mysql服务。
    发布时间:2021-03-18 13:26:50
  • 【吐槽+分享】商超类店铺商品真够多啊,一个华润万家店铺商品数超过了7000件。

    分享:
    美团外卖华润万家(益田店),店铺APP ID:6043548,地址:深圳市福田区福民路北面皇达东方雅苑裙楼。全量商品数据(约7000条),采集时间:2021-03-16
    数据下载链接:http://t.cn/A6tuEDLa

    字段说明:
    'id' - 商品ID;
    'category' - 所属分类(商家自定义分类);
    'name' - 商品名称;
    'min_price' - 商品价格;
    'origin_price' - 商品原价;
    'member_price' - 会员价;
    'unit' - 单位;
    'min_order_count' - 最少起售量;
    'spec' - 规格;
    'real_stock' - 库存;
    'month_saled_content' - 月销量;
    'praise_content' - 点赞数;
    'activity_tag' - 所属活动;
    'promotion_info' - 促销信息;
    'picture' - 商品图片;
    发布时间:2021-03-16 12:53:34
  • 【经验分享】python lxml xpath 如何获取元素的原始xml(html)?
    考虑场景:xpath遍历到某个element后,想用正则regex提取这个元素原始html的部分信息,那么如何获取元素的原始html呢?
    使用etree.tostring(element, encoding='unicode')即可,注意这里的encoding参数:
    encoding  is the output encoding (default is US-ASCII). Use encoding="unicode" to generate a Unicode string (otherwise, a bytestring is generated).

    参考:
    https://stackoverflow.com/questions/14896302/get-the-inner-html-of-a-element-in-lxml
    http://t.cn/A6tQLsHg
    发布时间:2021-03-11 11:26:02
  • 【经验分享】Python中如何将被转义过的字符串还原?使用.decode('string-escape')
    例如:
    escaped_str = '{\"payload\":{\"0\":{\"k1\":\"v1\", \"k2\":\"v2\", \"k3\":\"v3\"}, \"1\":{\"k4\":\"v5\", \"k6\":\"v4\", \"k5\":\"v6\"}}}'
    经过escaped_str.decode('string_escape')之后,还原成:
    '{"payload":{"0":{"k1":"v1", "k2":"v2", "k3":"v3"}, "1":{"k4":"v5", "k6":"v4", "k5":"v6"}}}'

    再例如:
    escaped_str = '\\xe9\\xb2\\xb2\\xe9\\xb9\\x8f\\xe6\\x95\\xb0\\xe6\\x8d\\xae'
    经过escaped_str.decode('string_escape')之后,还原成:
    '鲲鹏数据'
    发布时间:2021-03-09 15:34:03
当前位置: 首页 > 高品质鲲鹏ADSL动态IP稳定高匿HTTP代理(独享版)

高品质鲲鹏ADSL动态IP稳定高匿HTTP代理(独享版)

 

  • 海量ADSL IP池(每个城市IP池大小不同)资源, 所有IP均为国内电信/联通IP.
  • 可同时获取N个IP(你需要购买N个账号的套餐),通过API接口获取(详见API文档).
  • 独享IP,独享线路,  可随时通过API改变部分或全部IP(详见API文档).
  • 所有代理均为高匿代理(Elite类型),服务器检测不到真实源IP.
  • 所有代理访问均需要通过用户名和密码授权.
  • 所有代理均没有带宽和流量限制.
  • 所有代理都是HTTP/HTTPS类型,没有SOCKS类型.
  • 这些代理尤其适合用于采集对IP访问频率限制严格的网站(例如,工商系统、淘宝、京东).
  • 不要将其用于做任何违法或具有攻击性的事情.
  • 如果我们收到滥用举报,你的账户将被终止(包括恶意评论).
  • 不能用于翻墙(例如,Facebook,Twitter).
鲲鹏ADSL动态IP代理工作原理图

 

提示:

1. 可申请免费测试,请联系客服QQ1649677458。

2. 由于目前ADSL线路资源紧张!购买请先联系客服QQ1649677458预约!

价格:80元/月/ADSL账号(开票加10%税)

最少租用时间:30天

最少租用数量:10个账号

授权方式:

支持以下方式:

  • 代理通过用户名和密码进行授权保护。请告之您想要设置的用户名和密码。代理端口:8888。
  • 也可绑定客户端IP(前提是你的客户端IP是固定的)。代理端口:7777。

API接口通过访问令牌(token)进行授权。请联系客服索取你的令牌参数。

 
这里有个基础教程,可以帮你快速上手:https://shimo.im/doc/DkBBxr7VGjQuNl8E,更高级的用法请查看API文档:点击查看 《鲲鹏ADSL动态IP HTTP代理 API文档》
 
如有疑问可直接通过网页右侧联系方式与我们沟通,或直接与在线QQ客服1649677458联系。
我们提供更多的稳定高匿HTTP代理方案,详情请查看这里http://www.site-digger.com/html/proxies.html
如何在浏览器或者自己编写的程序中使用代理?点击查看说明文档

 

QQ在线客服
欢迎咨询,点击这里给我发送消息。
欢迎咨询,点击这里给我发送消息。

加微信咨询