[PATCH] md: allow md/raid_disks to be settable

[firefly-linux-kernel-4.4.55.git] / drivers / md / md.c
diff --git a/drivers/md/md.c b/drivers/md/md.c

index 292dad31d5e508f992650effa60306bd29e0c99f..86e9f2efae5c7b95c69074f73f92e66a706d48c2 100644 (file)
--- a/drivers/md/md.c
+++ b/drivers/md/md.c
@@ -42,6 +42,7 @@
  #include <linux/devfs_fs_kernel.h>
  #include <linux/buffer_head.h> /* for invalidate_bdev */
  #include <linux/suspend.h>
+#include <linux/poll.h>
  
  #include <linux/init.h>
  
@@ -67,7 +68,7 @@
  static void autostart_arrays (int part);
  #endif
  
-static mdk_personality_t *pers[MAX_PERSONALITY];
+static LIST_HEAD(pers_list);
  static DEFINE_SPINLOCK(pers_lock);
  
  /*
@@ -133,6 +134,24 @@ static struct block_device_operations md_fops;
  
  static int start_readonly;
  
+/*
+ * We have a system wide 'event count' that is incremented
+ * on any 'interesting' event, and readers of /proc/mdstat
+ * can use 'poll' or 'select' to find out when the event
+ * count increases.
+ *
+ * Events are:
+ *  start array, stop array, error, add device, remove device,
+ *  start build, activate spare
+ */
+static DECLARE_WAIT_QUEUE_HEAD(md_event_waiters);
+static atomic_t md_event_count;
+static void md_new_event(mddev_t *mddev)
+{
+       atomic_inc(&md_event_count);
+       wake_up(&md_event_waiters);
+}
+
  /*
   * Enables to iterate over all existing md arrays
   * all_mddevs_lock protects this list.
@@ -209,12 +228,10 @@ static mddev_t * mddev_find(dev_t unit)
         }
         spin_unlock(&all_mddevs_lock);
  
-       new = (mddev_t *) kmalloc(sizeof(*new), GFP_KERNEL);
+       new = kzalloc(sizeof(*new), GFP_KERNEL);
         if (!new)
                 return NULL;
  
-       memset(new, 0, sizeof(*new));
-
         new->unit = unit;
         if (MAJOR(unit) == MD_MAJOR)
                 new->md_minor = MINOR(unit);
@@ -262,7 +279,7 @@ static inline void mddev_unlock(mddev_t * mddev)
         md_wakeup_thread(mddev->thread);
  }
  
-mdk_rdev_t * find_rdev_nr(mddev_t *mddev, int nr)
+static mdk_rdev_t * find_rdev_nr(mddev_t *mddev, int nr)
  {
         mdk_rdev_t * rdev;
         struct list_head *tmp;
@@ -286,6 +303,18 @@ static mdk_rdev_t * find_rdev(mddev_t * mddev, dev_t dev)
         return NULL;
  }
  
+static struct mdk_personality *find_pers(int level, char *clevel)
+{
+       struct mdk_personality *pers;
+       list_for_each_entry(pers, &pers_list, list) {
+               if (level != LEVEL_NONE && pers->level == level)
+                       return pers;
+               if (strcmp(pers->name, clevel)==0)
+                       return pers;
+       }
+       return NULL;
+}
+
  static inline sector_t calc_dev_sboffset(struct block_device *bdev)
  {
         sector_t size = bdev->bd_inode->i_size >> BLOCK_SIZE_BITS;
@@ -320,7 +349,7 @@ static int alloc_disk_sb(mdk_rdev_t * rdev)
  static void free_disk_sb(mdk_rdev_t * rdev)
  {
         if (rdev->sb_page) {
-               page_cache_release(rdev->sb_page);
+               put_page(rdev->sb_page);
                 rdev->sb_loaded = 0;
                 rdev->sb_page = NULL;
                 rdev->sb_offset = 0;
@@ -461,6 +490,7 @@ int sync_page_io(struct block_device *bdev, sector_t sector, int size,
         bio_put(bio);
         return ret;
  }
+EXPORT_SYMBOL_GPL(sync_page_io);
  
  static int read_disk_sb(mdk_rdev_t * rdev, int size)
  {
@@ -688,6 +718,7 @@ static int super_90_validate(mddev_t *mddev, mdk_rdev_t *rdev)
                 mddev->ctime = sb->ctime;
                 mddev->utime = sb->utime;
                 mddev->level = sb->level;
+               mddev->clevel[0] = 0;
                 mddev->layout = sb->layout;
                 mddev->raid_disks = sb->raid_disks;
                 mddev->size = sb->size;
@@ -714,9 +745,10 @@ static int super_90_validate(mddev_t *mddev, mdk_rdev_t *rdev)
  
                 if (sb->state & (1<<MD_SB_BITMAP_PRESENT) &&
                     mddev->bitmap_file == NULL) {
-                       if (mddev->level != 1 && mddev->level != 5 && mddev->level != 6) {
+                       if (mddev->level != 1 && mddev->level != 5 && mddev->level != 6
+                           && mddev->level != 10) {
                                 /* FIXME use a better test */
-                               printk(KERN_WARNING "md: bitmaps only support for raid1\n");
+                               printk(KERN_WARNING "md: bitmaps not supported for this level.\n");
                                 return -EINVAL;
                         }
                         mddev->bitmap_offset = mddev->default_bitmap_offset;
@@ -968,6 +1000,7 @@ static int super_1_load(mdk_rdev_t *rdev, mdk_rdev_t *refdev, int minor_version)
         }
         rdev->preferred_minor = 0xffff;
         rdev->data_offset = le64_to_cpu(sb->data_offset);
+       atomic_set(&rdev->corrected_errors, le32_to_cpu(sb->cnt_corrected_read));
  
         rdev->sb_size = le32_to_cpu(sb->max_dev) * 2 + 256;
         bmask = queue_hardsect_size(rdev->bdev->bd_disk->queue)-1;
@@ -1023,12 +1056,12 @@ static int super_1_validate(mddev_t *mddev, mdk_rdev_t *rdev)
                 mddev->ctime = le64_to_cpu(sb->ctime) & ((1ULL << 32)-1);
                 mddev->utime = le64_to_cpu(sb->utime) & ((1ULL << 32)-1);
                 mddev->level = le32_to_cpu(sb->level);
+               mddev->clevel[0] = 0;
                 mddev->layout = le32_to_cpu(sb->layout);
                 mddev->raid_disks = le32_to_cpu(sb->raid_disks);
                 mddev->size = le64_to_cpu(sb->size)/2;
                 mddev->events = le64_to_cpu(sb->events);
                 mddev->bitmap_offset = 0;
-               mddev->default_bitmap_offset = 0;
                 mddev->default_bitmap_offset = 1024;
                 
                 mddev->recovery_cp = le64_to_cpu(sb->resync_offset);
@@ -1038,8 +1071,9 @@ static int super_1_validate(mddev_t *mddev, mdk_rdev_t *rdev)
  
                 if ((le32_to_cpu(sb->feature_map) & MD_FEATURE_BITMAP_OFFSET) &&
                     mddev->bitmap_file == NULL ) {
-                       if (mddev->level != 1) {
-                               printk(KERN_WARNING "md: bitmaps only supported for raid1\n");
+                       if (mddev->level != 1 && mddev->level != 5 && mddev->level != 6
+                           && mddev->level != 10) {
+                               printk(KERN_WARNING "md: bitmaps not supported for this level.\n");
                                 return -EINVAL;
                         }
                         mddev->bitmap_offset = (__s32)le32_to_cpu(sb->bitmap_offset);
@@ -1106,6 +1140,8 @@ static void super_1_sync(mddev_t *mddev, mdk_rdev_t *rdev)
         else
                 sb->resync_offset = cpu_to_le64(0);
  
+       sb->cnt_corrected_read = atomic_read(&rdev->corrected_errors);
+
         if (mddev->bitmap && mddev->bitmap_file == NULL) {
                 sb->bitmap_offset = cpu_to_le32((__u32)mddev->bitmap_offset);
                 sb->feature_map = cpu_to_le32(MD_FEATURE_BITMAP_OFFSET);
@@ -1497,6 +1533,26 @@ repeat:
  
  }
  
+/* words written to sysfs files may, or my not, be \n terminated.
+ * We want to accept with case. For this we use cmd_match.
+ */
+static int cmd_match(const char *cmd, const char *str)
+{
+       /* See if cmd, written into a sysfs file, matches
+        * str.  They must either be the same, or cmd can
+        * have a trailing newline
+        */
+       while (*cmd && *str && *cmd == *str) {
+               cmd++;
+               str++;
+       }
+       if (*cmd == '\n')
+               cmd++;
+       if (*str || *cmd)
+               return 0;
+       return 1;
+}
+
  struct rdev_sysfs_entry {
         struct attribute attr;
         ssize_t (*show)(mdk_rdev_t *, char *);
@@ -1539,9 +1595,30 @@ super_show(mdk_rdev_t *rdev, char *page)
  }
  static struct rdev_sysfs_entry rdev_super = __ATTR_RO(super);
  
+static ssize_t
+errors_show(mdk_rdev_t *rdev, char *page)
+{
+       return sprintf(page, "%d\n", atomic_read(&rdev->corrected_errors));
+}
+
+static ssize_t
+errors_store(mdk_rdev_t *rdev, const char *buf, size_t len)
+{
+       char *e;
+       unsigned long n = simple_strtoul(buf, &e, 10);
+       if (*buf && (*e == 0 || *e == '\n')) {
+               atomic_set(&rdev->corrected_errors, n);
+               return len;
+       }
+       return -EINVAL;
+}
+static struct rdev_sysfs_entry rdev_errors =
+__ATTR(errors, 0644, errors_show, errors_store);
+
  static struct attribute *rdev_default_attrs[] = {
         &rdev_state.attr,
         &rdev_super.attr,
+       &rdev_errors.attr,
         NULL,
  };
  static ssize_t
@@ -1599,12 +1676,11 @@ static mdk_rdev_t *md_import_device(dev_t newdev, int super_format, int super_mi
         mdk_rdev_t *rdev;
         sector_t size;
  
-       rdev = (mdk_rdev_t *) kmalloc(sizeof(*rdev), GFP_KERNEL);
+       rdev = kzalloc(sizeof(*rdev), GFP_KERNEL);
         if (!rdev) {
                 printk(KERN_ERR "md: could not alloc mem for new device!\n");
                 return ERR_PTR(-ENOMEM);
         }
-       memset(rdev, 0, sizeof(*rdev));
  
         if ((err = alloc_disk_sb(rdev)))
                 goto abort_free;
@@ -1622,6 +1698,7 @@ static mdk_rdev_t *md_import_device(dev_t newdev, int super_format, int super_mi
         rdev->data_offset = 0;
         atomic_set(&rdev->nr_pending, 0);
         atomic_set(&rdev->read_errors, 0);
+       atomic_set(&rdev->corrected_errors, 0);
  
         size = rdev->bdev->bd_inode->i_size >> BLOCK_SIZE_BITS;
         if (!size) {
@@ -1726,29 +1803,183 @@ static void analyze_sbs(mddev_t * mddev)
  static ssize_t
  level_show(mddev_t *mddev, char *page)
  {
-       mdk_personality_t *p = mddev->pers;
-       if (p == NULL)
-               return 0;
-       if (mddev->level >= 0)
-               return sprintf(page, "RAID-%d\n", mddev->level);
-       else
+       struct mdk_personality *p = mddev->pers;
+       if (p)
                 return sprintf(page, "%s\n", p->name);
+       else if (mddev->clevel[0])
+               return sprintf(page, "%s\n", mddev->clevel);
+       else if (mddev->level != LEVEL_NONE)
+               return sprintf(page, "%d\n", mddev->level);
+       else
+               return 0;
  }
  
-static struct md_sysfs_entry md_level = __ATTR_RO(level);
+static ssize_t
+level_store(mddev_t *mddev, const char *buf, size_t len)
+{
+       int rv = len;
+       if (mddev->pers)
+               return -EBUSY;
+       if (len == 0)
+               return 0;
+       if (len >= sizeof(mddev->clevel))
+               return -ENOSPC;
+       strncpy(mddev->clevel, buf, len);
+       if (mddev->clevel[len-1] == '\n')
+               len--;
+       mddev->clevel[len] = 0;
+       mddev->level = LEVEL_NONE;
+       return rv;
+}
+
+static struct md_sysfs_entry md_level =
+__ATTR(level, 0644, level_show, level_store);
  
  static ssize_t
  raid_disks_show(mddev_t *mddev, char *page)
  {
+       if (mddev->raid_disks == 0)
+               return 0;
         return sprintf(page, "%d\n", mddev->raid_disks);
  }
  
-static struct md_sysfs_entry md_raid_disks = __ATTR_RO(raid_disks);
+static int update_raid_disks(mddev_t *mddev, int raid_disks);
  
  static ssize_t
-md_show_scan(mddev_t *mddev, char *page)
+raid_disks_store(mddev_t *mddev, const char *buf, size_t len)
  {
-       char *type = "none";
+       /* can only set raid_disks if array is not yet active */
+       char *e;
+       int rv = 0;
+       unsigned long n = simple_strtoul(buf, &e, 10);
+
+       if (!*buf || (*e && *e != '\n'))
+               return -EINVAL;
+
+       if (mddev->pers)
+               rv = update_raid_disks(mddev, n);
+       else
+               mddev->raid_disks = n;
+       return rv ? rv : len;
+}
+static struct md_sysfs_entry md_raid_disks =
+__ATTR(raid_disks, 0644, raid_disks_show, raid_disks_store);
+
+static ssize_t
+chunk_size_show(mddev_t *mddev, char *page)
+{
+       return sprintf(page, "%d\n", mddev->chunk_size);
+}
+
+static ssize_t
+chunk_size_store(mddev_t *mddev, const char *buf, size_t len)
+{
+       /* can only set chunk_size if array is not yet active */
+       char *e;
+       unsigned long n = simple_strtoul(buf, &e, 10);
+
+       if (mddev->pers)
+               return -EBUSY;
+       if (!*buf || (*e && *e != '\n'))
+               return -EINVAL;
+
+       mddev->chunk_size = n;
+       return len;
+}
+static struct md_sysfs_entry md_chunk_size =
+__ATTR(chunk_size, 0644, chunk_size_show, chunk_size_store);
+
+
+static ssize_t
+size_show(mddev_t *mddev, char *page)
+{
+       return sprintf(page, "%llu\n", (unsigned long long)mddev->size);
+}
+
+static int update_size(mddev_t *mddev, unsigned long size);
+
+static ssize_t
+size_store(mddev_t *mddev, const char *buf, size_t len)
+{
+       /* If array is inactive, we can reduce the component size, but
+        * not increase it (except from 0).
+        * If array is active, we can try an on-line resize
+        */
+       char *e;
+       int err = 0;
+       unsigned long long size = simple_strtoull(buf, &e, 10);
+       if (!*buf || *buf == '\n' ||
+           (*e && *e != '\n'))
+               return -EINVAL;
+
+       if (mddev->pers) {
+               err = update_size(mddev, size);
+               md_update_sb(mddev);
+       } else {
+               if (mddev->size == 0 ||
+                   mddev->size > size)
+                       mddev->size = size;
+               else
+                       err = -ENOSPC;
+       }
+       return err ? err : len;
+}
+
+static struct md_sysfs_entry md_size =
+__ATTR(component_size, 0644, size_show, size_store);
+
+
+/* Metdata version.
+ * This is either 'none' for arrays with externally managed metadata,
+ * or N.M for internally known formats
+ */
+static ssize_t
+metadata_show(mddev_t *mddev, char *page)
+{
+       if (mddev->persistent)
+               return sprintf(page, "%d.%d\n",
+                              mddev->major_version, mddev->minor_version);
+       else
+               return sprintf(page, "none\n");
+}
+
+static ssize_t
+metadata_store(mddev_t *mddev, const char *buf, size_t len)
+{
+       int major, minor;
+       char *e;
+       if (!list_empty(&mddev->disks))
+               return -EBUSY;
+
+       if (cmd_match(buf, "none")) {
+               mddev->persistent = 0;
+               mddev->major_version = 0;
+               mddev->minor_version = 90;
+               return len;
+       }
+       major = simple_strtoul(buf, &e, 10);
+       if (e==buf || *e != '.')
+               return -EINVAL;
+       buf = e+1;
+       minor = simple_strtoul(buf, &e, 10);
+       if (e==buf || *e != '\n')
+               return -EINVAL;
+       if (major >= sizeof(super_types)/sizeof(super_types[0]) ||
+           super_types[major].name == NULL)
+               return -ENOENT;
+       mddev->major_version = major;
+       mddev->minor_version = minor;
+       mddev->persistent = 1;
+       return len;
+}
+
+static struct md_sysfs_entry md_metadata =
+__ATTR(metadata_version, 0644, metadata_show, metadata_store);
+
+static ssize_t
+action_show(mddev_t *mddev, char *page)
+{
+       char *type = "idle";
         if (test_bit(MD_RECOVERY_RUNNING, &mddev->recovery) ||
             test_bit(MD_RECOVERY_NEEDED, &mddev->recovery)) {
                 if (test_bit(MD_RECOVERY_SYNC, &mddev->recovery)) {
@@ -1765,26 +1996,31 @@ md_show_scan(mddev_t *mddev, char *page)
  }
  
  static ssize_t
-md_store_scan(mddev_t *mddev, const char *page, size_t len)
+action_store(mddev_t *mddev, const char *page, size_t len)
  {
-       int canscan=0;
-
-       if (test_bit(MD_RECOVERY_RUNNING, &mddev->recovery) ||
-           test_bit(MD_RECOVERY_NEEDED, &mddev->recovery))
-               return -EBUSY;
-
-       if (mddev->pers && mddev->pers->sync_request)
-               canscan=1;
-
-       if (!canscan)
+       if (!mddev->pers || !mddev->pers->sync_request)
                 return -EINVAL;
  
-       if (strcmp(page, "check")==0 || strcmp(page, "check\n")==0)
-               set_bit(MD_RECOVERY_CHECK, &mddev->recovery);
-       else if (strcmp(page, "repair")!=0 && strcmp(page, "repair\n")!=0)
-               return -EINVAL;
-       set_bit(MD_RECOVERY_REQUESTED, &mddev->recovery);
-       set_bit(MD_RECOVERY_SYNC, &mddev->recovery);
+       if (cmd_match(page, "idle")) {
+               if (mddev->sync_thread) {
+                       set_bit(MD_RECOVERY_INTR, &mddev->recovery);
+                       md_unregister_thread(mddev->sync_thread);
+                       mddev->sync_thread = NULL;
+                       mddev->recovery = 0;
+               }
+       } else if (test_bit(MD_RECOVERY_RUNNING, &mddev->recovery) ||
+                  test_bit(MD_RECOVERY_NEEDED, &mddev->recovery))
+               return -EBUSY;
+       else if (cmd_match(page, "resync") || cmd_match(page, "recover"))
+               set_bit(MD_RECOVERY_NEEDED, &mddev->recovery);
+       else {
+               if (cmd_match(page, "check"))
+                       set_bit(MD_RECOVERY_CHECK, &mddev->recovery);
+               else if (cmd_match(page, "repair"))
+                       return -EINVAL;
+               set_bit(MD_RECOVERY_REQUESTED, &mddev->recovery);
+               set_bit(MD_RECOVERY_SYNC, &mddev->recovery);
+       }
         set_bit(MD_RECOVERY_NEEDED, &mddev->recovery);
         md_wakeup_thread(mddev->thread);
         return len;
@@ -1798,7 +2034,7 @@ mismatch_cnt_show(mddev_t *mddev, char *page)
  }
  
  static struct md_sysfs_entry
-md_scan_mode = __ATTR(scan_mode, S_IRUGO|S_IWUSR, md_show_scan, md_store_scan);
+md_scan_mode = __ATTR(sync_action, S_IRUGO|S_IWUSR, action_show, action_store);
  
  
  static struct md_sysfs_entry
@@ -1807,6 +2043,9 @@ md_mismatches = __ATTR_RO(mismatch_cnt);
  static struct attribute *md_default_attrs[] = {
         &md_level.attr,
         &md_raid_disks.attr,
+       &md_chunk_size.attr,
+       &md_size.attr,
+       &md_metadata.attr,
         NULL,
  };
  
@@ -1927,14 +2166,16 @@ static void md_safemode_timeout(unsigned long data)
         md_wakeup_thread(mddev->thread);
  }
  
+static int start_dirty_degraded;
  
  static int do_md_run(mddev_t * mddev)
  {
-       int pnum, err;
+       int err;
         int chunk_size;
         struct list_head *tmp;
         mdk_rdev_t *rdev;
         struct gendisk *disk;
+       struct mdk_personality *pers;
         char b[BDEVNAME_SIZE];
  
         if (list_empty(&mddev->disks))
@@ -1951,20 +2192,8 @@ static int do_md_run(mddev_t * mddev)
                 analyze_sbs(mddev);
  
         chunk_size = mddev->chunk_size;
-       pnum = level_to_pers(mddev->level);
  
-       if ((pnum != MULTIPATH) && (pnum != RAID1)) {
-               if (!chunk_size) {
-                       /*
-                        * 'default chunksize' in the old md code used to
-                        * be PAGE_SIZE, baaad.
-                        * we abort here to be on the safe side. We don't
-                        * want to continue the bad practice.
-                        */
-                       printk(KERN_ERR 
-                               "no chunksize specified, see 'man raidtab'\n");
-                       return -EINVAL;
-               }
+       if (chunk_size) {
                 if (chunk_size > MAX_CHUNK_SIZE) {
                         printk(KERN_ERR "too big chunk_size: %d > %d\n",
                                 chunk_size, MAX_CHUNK_SIZE);
@@ -2000,10 +2229,10 @@ static int do_md_run(mddev_t * mddev)
         }
  
  #ifdef CONFIG_KMOD
-       if (!pers[pnum])
-       {
-               request_module("md-personality-%d", pnum);
-       }
+       if (mddev->level != LEVEL_NONE)
+               request_module("md-level-%d", mddev->level);
+       else if (mddev->clevel[0])
+               request_module("md-%s", mddev->clevel);
  #endif
  
         /*
@@ -2025,30 +2254,39 @@ static int do_md_run(mddev_t * mddev)
                 return -ENOMEM;
  
         spin_lock(&pers_lock);
-       if (!pers[pnum] || !try_module_get(pers[pnum]->owner)) {
+       pers = find_pers(mddev->level, mddev->clevel);
+       if (!pers || !try_module_get(pers->owner)) {
                 spin_unlock(&pers_lock);
-               printk(KERN_WARNING "md: personality %d is not loaded!\n",
-                      pnum);
+               if (mddev->level != LEVEL_NONE)
+                       printk(KERN_WARNING "md: personality for level %d is not loaded!\n",
+                              mddev->level);
+               else
+                       printk(KERN_WARNING "md: personality for level %s is not loaded!\n",
+                              mddev->clevel);
                 return -EINVAL;
         }
-
-       mddev->pers = pers[pnum];
+       mddev->pers = pers;
         spin_unlock(&pers_lock);
+       mddev->level = pers->level;
+       strlcpy(mddev->clevel, pers->name, sizeof(mddev->clevel));
  
         mddev->recovery = 0;
         mddev->resync_max_sectors = mddev->size << 1; /* may be over-ridden by personality */
         mddev->barriers_work = 1;
+       mddev->ok_start_degraded = start_dirty_degraded;
  
         if (start_readonly)
                 mddev->ro = 2; /* read-only, but switch on first write */
  
-       /* before we start the array running, initialise the bitmap */
-       err = bitmap_create(mddev);
-       if (err)
-               printk(KERN_ERR "%s: failed to create bitmap (%d)\n",
-                       mdname(mddev), err);
-       else
-               err = mddev->pers->run(mddev);
+       err = mddev->pers->run(mddev);
+       if (!err && mddev->pers->sync_request) {
+               err = bitmap_create(mddev);
+               if (err) {
+                       printk(KERN_ERR "%s: failed to create bitmap (%d)\n",
+                              mdname(mddev), err);
+                       mddev->pers->stop(mddev);
+               }
+       }
         if (err) {
                 printk(KERN_ERR "md: pers->run() failed ...\n");
                 module_put(mddev->pers->owner);
@@ -2058,6 +2296,9 @@ static int do_md_run(mddev_t * mddev)
         }
         if (mddev->pers->sync_request)
                 sysfs_create_group(&mddev->kobj, &md_redundancy_group);
+       else if (mddev->ro == 2) /* auto-readonly not meaningful */
+               mddev->ro = 0;
+
         atomic_set(&mddev->writes_pending,0);
         mddev->safemode = 0;
         mddev->safemode_timer.function = md_safemode_timeout;
@@ -2091,6 +2332,7 @@ static int do_md_run(mddev_t * mddev)
         mddev->queue->make_request_fn = mddev->pers->make_request;
  
         mddev->changed = 1;
+       md_new_event(mddev);
         return 0;
  }
  
@@ -2218,6 +2460,7 @@ static int do_md_stop(mddev_t * mddev, int ro)
                 printk(KERN_INFO "md: %s switched to read-only mode.\n",
                         mdname(mddev));
         err = 0;
+       md_new_event(mddev);
  out:
         return err;
  }
@@ -2692,6 +2935,7 @@ static int hot_remove_disk(mddev_t * mddev, dev_t dev)
  
         kick_rdev_from_array(rdev);
         md_update_sb(mddev);
+       md_new_event(mddev);
  
         return 0;
  busy:
@@ -2782,7 +3026,7 @@ static int hot_add_disk(mddev_t * mddev, dev_t dev)
          */
         set_bit(MD_RECOVERY_NEEDED, &mddev->recovery);
         md_wakeup_thread(mddev->thread);
-
+       md_new_event(mddev);
         return 0;
  
  abort_unbind_export:
@@ -2918,6 +3162,9 @@ static int set_array_info(mddev_t * mddev, mdu_array_info_t *info)
  
         mddev->sb_dirty      = 1;
  
+       mddev->default_bitmap_offset = MD_SB_BYTES >> 9;
+       mddev->bitmap_offset = 0;
+
         /*
          * Generate a 128 bit UUID
          */
@@ -2926,6 +3173,81 @@ static int set_array_info(mddev_t * mddev, mdu_array_info_t *info)
         return 0;
  }
  
+static int update_size(mddev_t *mddev, unsigned long size)
+{
+       mdk_rdev_t * rdev;
+       int rv;
+       struct list_head *tmp;
+
+       if (mddev->pers->resize == NULL)
+               return -EINVAL;
+       /* The "size" is the amount of each device that is used.
+        * This can only make sense for arrays with redundancy.
+        * linear and raid0 always use whatever space is available
+        * We can only consider changing the size if no resync
+        * or reconstruction is happening, and if the new size
+        * is acceptable. It must fit before the sb_offset or,
+        * if that is <data_offset, it must fit before the
+        * size of each device.
+        * If size is zero, we find the largest size that fits.
+        */
+       if (mddev->sync_thread)
+               return -EBUSY;
+       ITERATE_RDEV(mddev,rdev,tmp) {
+               sector_t avail;
+               int fit = (size == 0);
+               if (rdev->sb_offset > rdev->data_offset)
+                       avail = (rdev->sb_offset*2) - rdev->data_offset;
+               else
+                       avail = get_capacity(rdev->bdev->bd_disk)
+                               - rdev->data_offset;
+               if (fit && (size == 0 || size > avail/2))
+                       size = avail/2;
+               if (avail < ((sector_t)size << 1))
+                       return -ENOSPC;
+       }
+       rv = mddev->pers->resize(mddev, (sector_t)size *2);
+       if (!rv) {
+               struct block_device *bdev;
+
+               bdev = bdget_disk(mddev->gendisk, 0);
+               if (bdev) {
+                       down(&bdev->bd_inode->i_sem);
+                       i_size_write(bdev->bd_inode, mddev->array_size << 10);
+                       up(&bdev->bd_inode->i_sem);
+                       bdput(bdev);
+               }
+       }
+       return rv;
+}
+
+static int update_raid_disks(mddev_t *mddev, int raid_disks)
+{
+       int rv;
+       /* change the number of raid disks */
+       if (mddev->pers->reshape == NULL)
+               return -EINVAL;
+       if (raid_disks <= 0 ||
+           raid_disks >= mddev->max_disks)
+               return -EINVAL;
+       if (mddev->sync_thread)
+               return -EBUSY;
+       rv = mddev->pers->reshape(mddev, raid_disks);
+       if (!rv) {
+               struct block_device *bdev;
+
+               bdev = bdget_disk(mddev->gendisk, 0);
+               if (bdev) {
+                       down(&bdev->bd_inode->i_sem);
+                       i_size_write(bdev->bd_inode, mddev->array_size << 10);
+                       up(&bdev->bd_inode->i_sem);
+                       bdput(bdev);
+               }
+       }
+       return rv;
+}
+
+
  /*
   * update_array_info is used to change the configuration of an
   * on-line array.
@@ -2974,71 +3296,12 @@ static int update_array_info(mddev_t *mddev, mdu_array_info_t *info)
                 else
                         return mddev->pers->reconfig(mddev, info->layout, -1);
         }
-       if (mddev->size != info->size) {
-               mdk_rdev_t * rdev;
-               struct list_head *tmp;
-               if (mddev->pers->resize == NULL)
-                       return -EINVAL;
-               /* The "size" is the amount of each device that is used.
-                * This can only make sense for arrays with redundancy.
-                * linear and raid0 always use whatever space is available
-                * We can only consider changing the size if no resync
-                * or reconstruction is happening, and if the new size
-                * is acceptable. It must fit before the sb_offset or,
-                * if that is <data_offset, it must fit before the
-                * size of each device.
-                * If size is zero, we find the largest size that fits.
-                */
-               if (mddev->sync_thread)
-                       return -EBUSY;
-               ITERATE_RDEV(mddev,rdev,tmp) {
-                       sector_t avail;
-                       int fit = (info->size == 0);
-                       if (rdev->sb_offset > rdev->data_offset)
-                               avail = (rdev->sb_offset*2) - rdev->data_offset;
-                       else
-                               avail = get_capacity(rdev->bdev->bd_disk)
-                                       - rdev->data_offset;
-                       if (fit && (info->size == 0 || info->size > avail/2))
-                               info->size = avail/2;
-                       if (avail < ((sector_t)info->size << 1))
-                               return -ENOSPC;
-               }
-               rv = mddev->pers->resize(mddev, (sector_t)info->size *2);
-               if (!rv) {
-                       struct block_device *bdev;
-
-                       bdev = bdget_disk(mddev->gendisk, 0);
-                       if (bdev) {
-                               down(&bdev->bd_inode->i_sem);
-                               i_size_write(bdev->bd_inode, mddev->array_size << 10);
-                               up(&bdev->bd_inode->i_sem);
-                               bdput(bdev);
-                       }
-               }
-       }
-       if (mddev->raid_disks    != info->raid_disks) {
-               /* change the number of raid disks */
-               if (mddev->pers->reshape == NULL)
-                       return -EINVAL;
-               if (info->raid_disks <= 0 ||
-                   info->raid_disks >= mddev->max_disks)
-                       return -EINVAL;
-               if (mddev->sync_thread)
-                       return -EBUSY;
-               rv = mddev->pers->reshape(mddev, info->raid_disks);
-               if (!rv) {
-                       struct block_device *bdev;
-
-                       bdev = bdget_disk(mddev->gendisk, 0);
-                       if (bdev) {
-                               down(&bdev->bd_inode->i_sem);
-                               i_size_write(bdev->bd_inode, mddev->array_size << 10);
-                               up(&bdev->bd_inode->i_sem);
-                               bdput(bdev);
-                       }
-               }
-       }
+       if (mddev->size != info->size)
+               rv = update_size(mddev, info->size);
+
+       if (mddev->raid_disks    != info->raid_disks)
+               rv = update_raid_disks(mddev, info->raid_disks);
+
         if ((state ^ info->state) & (1<<MD_SB_BITMAP_PRESENT)) {
                 if (mddev->pers->quiesce == NULL)
                         return -EINVAL;
@@ -3142,7 +3405,7 @@ static int md_ioctl(struct inode *inode, struct file *file,
                 if (cnt > 0 ) {
                         printk(KERN_WARNING
                                "md: %s(pid %d) used deprecated START_ARRAY ioctl. "
-                              "This will not be supported beyond 2.6\n",
+                              "This will not be supported beyond July 2006\n",
                                current->comm, current->pid);
                         cnt--;
                 }
@@ -3421,21 +3684,26 @@ static int md_thread(void * arg)
          */
  
         allow_signal(SIGKILL);
-       complete(thread->event);
         while (!kthread_should_stop()) {
-               void (*run)(mddev_t *);
  
-               wait_event_interruptible_timeout(thread->wqueue,
-                                                test_bit(THREAD_WAKEUP, &thread->flags)
-                                                || kthread_should_stop(),
-                                                thread->timeout);
+               /* We need to wait INTERRUPTIBLE so that
+                * we don't add to the load-average.
+                * That means we need to be sure no signals are
+                * pending
+                */
+               if (signal_pending(current))
+                       flush_signals(current);
+
+               wait_event_interruptible_timeout
+                       (thread->wqueue,
+                        test_bit(THREAD_WAKEUP, &thread->flags)
+                        || kthread_should_stop(),
+                        thread->timeout);
                 try_to_freeze();
  
                 clear_bit(THREAD_WAKEUP, &thread->flags);
  
-               run = thread->run;
-               if (run)
-                       run(thread->mddev);
+               thread->run(thread->mddev);
         }
  
         return 0;
@@ -3454,27 +3722,21 @@ mdk_thread_t *md_register_thread(void (*run) (mddev_t *), mddev_t *mddev,
                                  const char *name)
  {
         mdk_thread_t *thread;
-       struct completion event;
  
-       thread = kmalloc(sizeof(mdk_thread_t), GFP_KERNEL);
+       thread = kzalloc(sizeof(mdk_thread_t), GFP_KERNEL);
         if (!thread)
                 return NULL;
  
-       memset(thread, 0, sizeof(mdk_thread_t));
         init_waitqueue_head(&thread->wqueue);
  
-       init_completion(&event);
-       thread->event = &event;
         thread->run = run;
         thread->mddev = mddev;
-       thread->name = name;
         thread->timeout = MAX_SCHEDULE_TIMEOUT;
         thread->tsk = kthread_run(md_thread, thread, name, mdname(thread->mddev));
         if (IS_ERR(thread->tsk)) {
                 kfree(thread);
                 return NULL;
         }
-       wait_for_completion(&event);
         return thread;
  }
  
@@ -3508,6 +3770,7 @@ void md_error(mddev_t *mddev, mdk_rdev_t *rdev)
         set_bit(MD_RECOVERY_INTR, &mddev->recovery);
         set_bit(MD_RECOVERY_NEEDED, &mddev->recovery);
         md_wakeup_thread(mddev->thread);
+       md_new_event(mddev);
  }
  
  /* seq_file implementation /proc/mdstat */
@@ -3648,24 +3911,29 @@ static void md_seq_stop(struct seq_file *seq, void *v)
                 mddev_put(mddev);
  }
  
+struct mdstat_info {
+       int event;
+};
+
  static int md_seq_show(struct seq_file *seq, void *v)
  {
         mddev_t *mddev = v;
         sector_t size;
         struct list_head *tmp2;
         mdk_rdev_t *rdev;
-       int i;
+       struct mdstat_info *mi = seq->private;
         struct bitmap *bitmap;
  
         if (v == (void*)1) {
+               struct mdk_personality *pers;
                 seq_printf(seq, "Personalities : ");
                 spin_lock(&pers_lock);
-               for (i = 0; i < MAX_PERSONALITY; i++)
-                       if (pers[i])
-                               seq_printf(seq, "[%s] ", pers[i]->name);
+               list_for_each_entry(pers, &pers_list, list)
+                       seq_printf(seq, "[%s] ", pers->name);
  
                 spin_unlock(&pers_lock);
                 seq_printf(seq, "\n");
+               mi->event = atomic_read(&md_event_count);
                 return 0;
         }
         if (v == (void*)2) {
@@ -3722,13 +3990,15 @@ static int md_seq_show(struct seq_file *seq, void *v)
                 if (mddev->pers) {
                         mddev->pers->status (seq, mddev);
                         seq_printf(seq, "\n      ");
-                       if (mddev->curr_resync > 2) {
-                               status_resync (seq, mddev);
-                               seq_printf(seq, "\n      ");
-                       } else if (mddev->curr_resync == 1 || mddev->curr_resync == 2)
-                               seq_printf(seq, "\tresync=DELAYED\n      ");
-                       else if (mddev->recovery_cp < MaxSector)
-                               seq_printf(seq, "\tresync=PENDING\n      ");
+                       if (mddev->pers->sync_request) {
+                               if (mddev->curr_resync > 2) {
+                                       status_resync (seq, mddev);
+                                       seq_printf(seq, "\n      ");
+                               } else if (mddev->curr_resync == 1 || mddev->curr_resync == 2)
+                                       seq_printf(seq, "\tresync=DELAYED\n      ");
+                               else if (mddev->recovery_cp < MaxSector)
+                                       seq_printf(seq, "\tresync=PENDING\n      ");
+                       }
                 } else
                         seq_printf(seq, "\n       ");
  
@@ -3772,47 +4042,68 @@ static struct seq_operations md_seq_ops = {
  static int md_seq_open(struct inode *inode, struct file *file)
  {
         int error;
+       struct mdstat_info *mi = kmalloc(sizeof(*mi), GFP_KERNEL);
+       if (mi == NULL)
+               return -ENOMEM;
  
         error = seq_open(file, &md_seq_ops);
+       if (error)
+               kfree(mi);
+       else {
+               struct seq_file *p = file->private_data;
+               p->private = mi;
+               mi->event = atomic_read(&md_event_count);
+       }
         return error;
  }
  
+static int md_seq_release(struct inode *inode, struct file *file)
+{
+       struct seq_file *m = file->private_data;
+       struct mdstat_info *mi = m->private;
+       m->private = NULL;
+       kfree(mi);
+       return seq_release(inode, file);
+}
+
+static unsigned int mdstat_poll(struct file *filp, poll_table *wait)
+{
+       struct seq_file *m = filp->private_data;
+       struct mdstat_info *mi = m->private;
+       int mask;
+
+       poll_wait(filp, &md_event_waiters, wait);
+
+       /* always allow read */
+       mask = POLLIN | POLLRDNORM;
+
+       if (mi->event != atomic_read(&md_event_count))
+               mask |= POLLERR | POLLPRI;
+       return mask;
+}
+
  static struct file_operations md_seq_fops = {
         .open           = md_seq_open,
         .read           = seq_read,
         .llseek         = seq_lseek,
-       .release        = seq_release,
+       .release        = md_seq_release,
+       .poll           = mdstat_poll,
  };
  
-int register_md_personality(int pnum, mdk_personality_t *p)
+int register_md_personality(struct mdk_personality *p)
  {
-       if (pnum >= MAX_PERSONALITY) {
-               printk(KERN_ERR
-                      "md: tried to install personality %s as nr %d, but max is %lu\n",
-                      p->name, pnum, MAX_PERSONALITY-1);
-               return -EINVAL;
-       }
-
         spin_lock(&pers_lock);
-       if (pers[pnum]) {
-               spin_unlock(&pers_lock);
-               return -EBUSY;
-       }
-
-       pers[pnum] = p;
-       printk(KERN_INFO "md: %s personality registered as nr %d\n", p->name, pnum);
+       list_add_tail(&p->list, &pers_list);
+       printk(KERN_INFO "md: %s personality registered for level %d\n", p->name, p->level);
         spin_unlock(&pers_lock);
         return 0;
  }
  
-int unregister_md_personality(int pnum)
+int unregister_md_personality(struct mdk_personality *p)
  {
-       if (pnum >= MAX_PERSONALITY)
-               return -EINVAL;
-
-       printk(KERN_INFO "md: %s personality unregistered\n", pers[pnum]->name);
+       printk(KERN_INFO "md: %s personality unregistered\n", p->name);
         spin_lock(&pers_lock);
-       pers[pnum] = NULL;
+       list_del_init(&p->list);
         spin_unlock(&pers_lock);
         return 0;
  }
@@ -3830,11 +4121,20 @@ static int is_mddev_idle(mddev_t *mddev)
                 curr_events = disk_stat_read(disk, sectors[0]) + 
                                 disk_stat_read(disk, sectors[1]) - 
                                 atomic_read(&disk->sync_io);
-               /* Allow some slack between valud of curr_events and last_events,
-                * as there are some uninteresting races.
+               /* The difference between curr_events and last_events
+                * will be affected by any new non-sync IO (making
+                * curr_events bigger) and any difference in the amount of
+                * in-flight syncio (making current_events bigger or smaller)
+                * The amount in-flight is currently limited to
+                * 32*64K in raid1/10 and 256*PAGE_SIZE in raid5/6
+                * which is at most 4096 sectors.
+                * These numbers are fairly fragile and should be made
+                * more robust, probably by enforcing the
+                * 'window size' that md_do_sync sort-of uses.
+                *
                  * Note: the following is an unsigned comparison.
                  */
-               if ((curr_events - rdev->last_events + 32) > 64) {
+               if ((curr_events - rdev->last_events + 4096) > 8192) {
                         rdev->last_events = curr_events;
                         idle = 0;
                 }
@@ -3936,9 +4236,7 @@ static void md_do_sync(mddev_t *mddev)
                 mddev->curr_resync = 2;
  
         try_again:
-               if (signal_pending(current) ||
-                   kthread_should_stop()) {
-                       flush_signals(current);
+               if (kthread_should_stop()) {
                         set_bit(MD_RECOVERY_INTR, &mddev->recovery);
                         goto skip;
                 }
@@ -3958,9 +4256,8 @@ static void md_do_sync(mddev_t *mddev)
                                          * time 'round when curr_resync == 2
                                          */
                                         continue;
-                               prepare_to_wait(&resync_wait, &wq, TASK_INTERRUPTIBLE);
-                               if (!signal_pending(current) &&
-                                   !kthread_should_stop() &&
+                               prepare_to_wait(&resync_wait, &wq, TASK_UNINTERRUPTIBLE);
+                               if (!kthread_should_stop() &&
                                     mddev2->curr_resync >= mddev->curr_resync) {
                                         printk(KERN_INFO "md: delaying resync of %s"
                                                " until %s has finished resync (they"
@@ -4045,7 +4342,11 @@ static void md_do_sync(mddev_t *mddev)
  
                 j += sectors;
                 if (j>1) mddev->curr_resync = j;
-
+               if (last_check == 0)
+                       /* this is the earliers that rebuilt will be
+                        * visible in /proc/mdstat
+                        */
+                       md_new_event(mddev);
  
                 if (last_check + window > io_sectors || j == max_sectors)
                         continue;
@@ -4069,13 +4370,12 @@ static void md_do_sync(mddev_t *mddev)
                 }
  
  
-               if (signal_pending(current) || kthread_should_stop()) {
+               if (kthread_should_stop()) {
                         /*
                          * got a signal, exit.
                          */
                         printk(KERN_INFO 
                                 "md: md_do_sync() got signal ... exiting\n");
-                       flush_signals(current);
                         set_bit(MD_RECOVERY_INTR, &mddev->recovery);
                         goto out;
                 }
@@ -4097,7 +4397,7 @@ static void md_do_sync(mddev_t *mddev)
                 if (currspeed > sysctl_speed_limit_min) {
                         if ((currspeed > sysctl_speed_limit_max) ||
                                         !is_mddev_idle(mddev)) {
-                               msleep_interruptible(250);
+                               msleep(500);
                                 goto repeat;
                         }
                 }
@@ -4232,6 +4532,7 @@ void md_check_recovery(mddev_t *mddev)
                         mddev->recovery = 0;
                         /* flag recovery needed just to double check */
                         set_bit(MD_RECOVERY_NEEDED, &mddev->recovery);
+                       md_new_event(mddev);
                         goto unlock;
                 }
                 /* Clear some bits that don't mean anything, but
@@ -4269,6 +4570,7 @@ void md_check_recovery(mddev_t *mddev)
                                                 sprintf(nm, "rd%d", rdev->raid_disk);
                                                 sysfs_create_link(&mddev->kobj, &rdev->kobj, nm);
                                                 spares++;
+                                               md_new_event(mddev);
                                         } else
                                                 break;
                                 }
@@ -4301,9 +4603,9 @@ void md_check_recovery(mddev_t *mddev)
                                         mdname(mddev));
                                 /* leave the spares where they are, it shouldn't hurt */
                                 mddev->recovery = 0;
-                       } else {
+                       } else
                                 md_wakeup_thread(mddev->sync_thread);
-                       }
+                       md_new_event(mddev);
                 }
         unlock:
                 mddev_unlock(mddev);
@@ -4480,12 +4782,14 @@ static int set_ro(const char *val, struct kernel_param *kp)
         int num = simple_strtoul(val, &e, 10);
         if (*val && (*e == '\0' || *e == '\n')) {
                 start_readonly = num;
-               return 0;;
+               return 0;
         }
         return -EINVAL;
  }
  
  module_param_call(start_ro, set_ro, get_ro, NULL, 0600);
+module_param(start_dirty_degraded, int, 0644);
+
  
  EXPORT_SYMBOL(register_md_personality);
  EXPORT_SYMBOL(unregister_md_personality);