更多>>关于我们

西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。

您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。

数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。

更多>>官方微博

西安鲲之鹏
陕西 西安

加关注

  • 【经验分享】QEMU/KVM如何修改开机启动顺序?
    virsh edit name-of-vm-instance
    如下示例:
     <os>
        <type arch='x86_64' machine='pc-i440fx-xenial'>hvm</type>
        <boot dev="network"></boot>
        <boot dev="cdrom"></boot>
        <boot dev="hd"></boot>
        <bootmenu enable='yes'/>
      </os>
    
    bootmenu的enable设置为yes,就可以在启动的时候按F12选择启动设备。
    •  
    发布时间:2024-03-12 11:51:28
  • 【经验分享】使用VNC远程连接KVM虚拟机,鼠标不同步而且偏移很大(想砸掉鼠标冲动的那种)问题解决:
    (1)编辑虚拟机配置文件,例如sudo virsh edit win10_1,然后将<input type="mouse" bus="ps2" />修改为<input type="tablet" bus="usb" /> 。
    (2)强制关闭虚拟机win10_1然后重启,问题解决。
    发布时间:2024-03-13 09:26:51
  • 【经验分享】Frida里Java.choose找到某个类的实例,在调用该实例方法时出现“script should be invoke on MainThread”问题的解决:

    // Assign the javascript code to a variable.
    jsCode = """
    // Create a method called Cheese that will be exported.
    function Cheese()
    {
    // Perform the code from injected context.
    Java.perform(function ()
    {
    // Variable to store the view representing the button
    // to click programmatically.
    var view;
    // Define the Runnable type javascript wrapper.
    var Runnable = Java.use("java.lang.Runnable");

    // Find the MainActivity class in myApp.
    Java.choose("com.example.myApp.MainActivity",
    {
    // Once it has been found execute the following code.
    onMatch: function(instance)
    {
    // Get the view representing button to click.
    // 2131436712 id derived from decompiling app.
    view = instance.findViewById(2131436712);
    // Define a new class that implements Runnable and provide
    // the implementation of the run() method which, will
    // execute from the Main thread.
    const MyRunnable = Java.registerClass({
    name:'com.example.MyRunnable',
    implements: [Runnable],
    methods: {
    // run executes button click.
    run(){
    instance.onClick(view);
    },
    }
    });

    // Create an instance of the class just created.
    var MyGuiUpdate = MyRunnable .$new();
    // Schedule the run method in MyGuiUpdate to
    // execute on the UI thread.
    instance.runOnUiThread(MyGuiUpdate );

    },
    onComplete:function(){}
    });
    解决方法来源:https://stackoverflow.com/questions/65790594/calling-an-api-to-modify-an-apps-gui-from-non-main-thread-in-frida
    发布时间:2024-02-23 13:00:33
  • 【经验分享】Frida script中如何给Java的Long类型变量赋值?
    例如,某Java类中有如下Long类型变量定义:
    /* renamed from: e */
    public Long f90137e;

    尝试修改e的值,依次做如下测试:
    (1)classObj.e.value = 1978705204; 会报"Error: Expected value compatible with java.lang.Long"错误。
    (2)classObj.e.value = Java.use('java.lang.Long').parseLong.overload('java.lang.String').call(Java.use('java.lang.Long'), "1978705204");依然会报上述错误。
    (3)这个方法可以成功赋值:classObj.e.value = Java.use('java.lang.Long').$new(1978705204);
    发布时间:2024-02-21 21:45:47
  • 【经验分享】miller使用filter查询条件,当遇到字段含有空格或者其它特殊字符时怎么处理?如下示例中某个字段含有点号,直接查询会报错。解决方法如下:

    示例:mlr --icsv --oxtab --from mouser_products_202312.csv filter '${Mfr.}=~"TDK" || ${Brand}=~"TDK"' then count

    使用Pandas时,也有类似问题,解决方法:
    df[df['Brand'].str.contains("TDK")|df['Mfr.'].str.contains("TDK")]
    另外,Stackoverflow(https://stackoverflow.com/questions/50697536/pandas-query-function-not-working-with-spaces-in-column-names)上有人说可以用`字段`将字段包裹起来,例如:a.query('`a b` == 5') ,但是需要Pandas是0.25版本,我机器上是0.24.2,测试没有效果。
    发布时间:2024-02-21 19:01:04
  • 【经验分享】今天本地windows系统adb shell突然报错"error: unknown host service",尝试"adb kill-server"、甚至重启PC和手机均不起作用。后来网上查了下,说是PC端adb的后台服务进程的5037端口被其它程序占用了。

    解决方法:使用netstat -ano找到并关闭占有者进程,问题解决。 ​​​
    发布时间:2024-02-21 18:55:05
  • 【经验分享】PPPOE认证返回“User Locked”,可能是因为MAC被拉黑了,换一个就好了。 ​​​
    发布时间:2024-01-16 13:00:17
  • 【经验分享】Linux如何限制一个命令的运行时长?可以使用timeout命令。
    例如,限制ping最多运行10秒,可以这样:
    timeout 10s ping www.baidu.com ​​​
    发布时间:2024-01-12 12:11:50
  • 【经验分享】Playwright库使用context.route()/page.route()过滤HTTP(S)请求时发现有Ajax漏包的情况。查官方文档,发现有云:
    browser_context.route() will not intercept requests intercepted by Service Worker. See this issue. We recommend disabling Service Workers when using request interception by setting browser.new_context.service_workers to 'block'.

    尝试:
    context = browser.new_context(service_workers='block')
    问题解决。

    参考1:https://playwright.dev/python/docs/api/class-browsercontext#browser-context-route
    参考2:https://github.com/microsoft/playwright/issues/15684
    发布时间:2024-01-10 11:56:20
  • 【经验分享】Python fontTools 获取字体文件的字形名称列表,遇到"smile", "question", "space"等AGL名称,如何将其转为Unicode代码?

    >>>import fontTools
    >>>hex(fontTools.agl.AGL2UV['smileface'])
    '0x263a'

    参考:https://fonttools.readthedocs.io/en/latest/_modules/fontTools/agl.html ​​​
    发布时间:2023-10-12 10:58:26
当前位置: 首页 > 公司微博 >
  • 西安鲲之鹏

    发布时间:2016-09-05 16:13:28
    Windows上使用rdp协议连接Ubuntu的远程桌面:
    sudo apt-get install xrdp
    sudo apt-get install vnc4server
    sudo apt-get install xubuntu-desktop
    echo "xfce4-session" > ~/.xsession
    sudo service xrdp restart
    然后Windows上用mstsc连接即可。
    xrdp: An open source remote desktop protocol(rdp) server. >>> http://t.cn/Rcy02TQ

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-09-05 14:50:45
    NppFTP使用SFTP连接Ubuntu 16.04错误提示“[SFTP] Connection failed : kex error : did not find one of algos ”。解决方法:升级NppFTP到最新版本即可(解压覆盖NppFTP.dll文件即可,我使用的是0.26.3)>>> http://t.cn/RcyXShb ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-09-03 09:38:59
    Chrome webdirver自定义用户配置文件时(--user-data-dir)参数不能加引号,否则会出错:“cannot create default profile directory”。一个正确的示例:options.add_argument('--user-data-dir=C:/Temp/ChromeProfile')。窗口启动后可以查看“chrome://version”是否生效。 >>> Stackoverflow上有个类似的问题 http://t.cn/RcAJsmt

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-31 20:06:15
    淘宝分类知多少?鲲之鹏今日统计结果12919个。 >>> http://t.cn/Rc7VoeO 你想知道怎么获取商品源码中"categoryId"对应的分类名称吗 >>> http://t.cn/Rc7Voe0? ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-26 16:52:19
    rp-pppoe-3.12中的pppoe-status有Bug,经常出现拨号获取到IP了(查看syslog可知),但pppoe-status判断拨号失败了(“Link is attached to ppp20, but ppp20 is down”)。我们写了一个Python版本的pppoe-status.py,它结合pppoe-status(原始的)和“ifconfig  iface”的结果判断拨号是否成功了。源码在这里 >>> http://t.cn/RtDZRb9。 PS:还需要修改/usr/sbin/pppoe-start将“${exec_prefix}/sbin/pppoe-status $CONFIG > /dev/null 2>&1”修改为“/usr/bin/python /home/qi/pppoe-status.py $CONFIG > /dev/null 2>&1”(根据实际路径修改)

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-26 14:09:18
    Notepad++  & NppFTP 插件实现Remote Edit,一个字“cool”! ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-26 12:57:50
    "Warning: Incorrect string value: '\xF0\x9F\x98\x83 @...' for column"导致字符串被截断问题的解决:将字段的编码从utf8修改为utf8mb4,程序连接MySQL的时候也要修改charset为utf8mb4。>>>  http://t.cn/8sI0SNw ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-26 09:09:46
    MySQL的“Text”类型允许的最大字节数:
    TINYTEXT: 256 bytes、
    TEXT: 65,535 bytes(很多时候不够用)、
    MEDIUMTEXT: 16,777,215 bytes、
    LONGTEXT: 4,294,967,295 bytes。超过限制就会提示“Data truncation”警告或者报错“Data too long”。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-24 14:21:26
    Hyper-V下创建的macvlan(伪造MAC拨号用)无法工作,勾选上"启用MAC地址的欺骗"(如下图)后,工作了! ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-24 12:54:55
    Ubuntu下pppoe-connect(start)提示“execvp: No such file or directory”,经查是pppd不存在,安装后问题解决:sudo apt-get install ppp ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-23 14:14:18
    How to solve "EnvironmentError: mysql_config not foun" problem when set-up MySQL for Python on Ubuntu? >>> http://t.cn/RtBW9q9 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-23 13:40:56
    大众点评国内目前已涵盖2379个“城市”(一些县甚至地区也被大众点评作为“城市”列出, .e.g http://www.dianping.com/shop/45321696)。为了提高可用性,我们对“城市”字段做了修正,增加“real_city”(真实城市)和“province”(省份)字段 >>> http://t.cn/RtB0cHX ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-20 09:57:39
    Linux how long a process has been running?   ps -p {PID-HERE} -o etime  >>> http://t.cn/RtmxWIB ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-20 09:47:38
    Linux Execute Cron Job After System Reboot:  @reboot  /path/to/job   >>> http://t.cn/RtmxvNz ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-08-18 10:32:07
    【“美味不用等App”采集分析】HTTP请求加入了签名机制(sign参数),但是存在Bug:sign的值仅与time和nonce两个常量参数(可以一直保持不变)有关,改变核心参数例如page,cityid,shopid请求依然合法。可以正常采集。 ​​​​

    阅读全文 + 去微博评论 +